ページを読み込み中…
ページを読み込み中…
8件の記事
Hugging Face は静止画像から連続動画へ拡張した深層調査エージェントを提案し、モダリティバイアスや知識漏洩への対応策を示した。
大規模言語モデルエージェントの強化学習において報酬が希薄な課題に対し、教師モデルの信頼性を考慮した永続的整合性(PCSD)手法を提案し、トークンレベルの学習効率向上を示した。
Hugging Face は、検証可能な報酬を用いた強化学習(RLVR)とオンポリシー蒸留(OPD)の長所を組み合わせた新手法「SAF-OPD」を提案し、両者の固定係数によるエントロピー崩壊問題を解決するアプローチを示した。
ラファ・シュウィンガーは、Claude の Mythos と Fable を逆解析し、競争優位性の源泉がアーキテクチャではなく環境基盤であると論じた。テキストや計算資源が不再重要となる中、検証可能な報酬が新たな決定的要素となっている。