ページを読み込み中…
1件の記事
Hugging Face は、検証可能な報酬を用いた強化学習(RLVR)とオンポリシー蒸留(OPD)の長所を組み合わせた新手法「SAF-OPD」を提案し、両者の固定係数によるエントロピー崩壊問題を解決するアプローチを示した。