ページを読み込み中…
ページを読み込み中…
19件の記事
TLDR AI は、大規模言語モデルの強化学習後学習を容易に構築・再現・運用するためのフレームワーク「Miles」を紹介した。このツールは、分散システム化が進む大規模 LLM 向けに、トレーニングの構成可能性と拡張性を高めつつ、研究者やインフラチームがコアトレーナーをカスタマイズできる設計となっている。
メタ社は、報酬モデルが同等の回答に対して過剰反応し、強化学習が報酬ハッキングに向かう可能性を研究した。論文では、識別能力と特異性の両方を測定し、モンテカルロドロップアウトを用いて報酬を安全な離散信号にクラスタリングする手法を提案している。
Z.ai が Claude Fable 5 の輸出規制の影響下で最新モデル GLM-5.2 を発表し、これはオープンエージェント分野において重要な進展であると評価されている。
著者が RLHF やポストトレーニングの基礎をまとめるため、Finbarr Timbers をポッドキャストに招き、Olmo 型レシピを最先端レベルへ引き上げるための現状と必要な手順について議論した。
ラファ・シュウィンガーは、Claude の Mythos と Fable を逆解析し、競争優位性の源泉がアーキテクチャではなく環境基盤であると論じた。テキストや計算資源が不再重要となる中、検証可能な報酬が新たな決定的要素となっている。
研究者が GPT モデルに内在する特定の偏り(ゴブリンの癖)を特定し、その発生メカニズムと影響範囲を分析した研究結果。