ページを読み込み中…
ページを読み込み中…
15件の記事
既存のヒューリスティックやパイプライン方式に代わり、異種ソース間でのスキル生成を統一モデル化する学習ベースのアプローチとして、強化学習を用いた段階的スキル生成手法が提案された。
Hugging Face は、大規模言語モデルエージェントが複雑な長期タスクを実行する際の課題に対し、状態管理問題を再定義した評価フレームワーク「LongHorizon-Harness」を提案し、自己評価の誤り伝播を防ぐ手法を示した。
Hugging Face は、検証可能な報酬を用いた強化学習(RLVR)とオンポリシー蒸留(OPD)の長所を組み合わせた新手法「SAF-OPD」を提案し、両者の固定係数によるエントロピー崩壊問題を解決するアプローチを示した。
Hugging Face が、化学分野の論文から断片的な知見を組み合わせて回答を生成する仕組みとして、文書単位ではなく出典付きの主張(claim)を検索単位とするインフラ「AskChem」を発表した。