ページを読み込み中…
ページを読み込み中…
8件の記事
Hugging Face Transformers、PyTorch、PEFT を使用し、XYZ-Aquila-SFT データセットに対するエンドツーエンドの教師あり微調整パイプラインを実装するチュートリアルが公開された。
Hugging Face は LLM ポストトレーニング手法 OPD^2 を研究し、Qwen3 で英語・韓国語・日本語の数学推論で有効性を示した。
Hugging Face は、教師モデルが学習時に持つ情報と推論時の学生モデルとの非対称性が性能低下を招く「特権幻想」の問題に対し、双アンカー型ポリシー蒸留(DAPD)手法を提案し、その有効性を示した。
Hugging Face は、検証可能な報酬を用いた強化学習(RLVR)とオンポリシー蒸留(OPD)の長所を組み合わせた新手法「SAF-OPD」を提案し、両者の固定係数によるエントロピー崩壊問題を解決するアプローチを示した。