ページを読み込み中…
1件の記事
Hugging Face は、教師モデルが学習時に持つ情報と推論時の学生モデルとの非対称性が性能低下を招く「特権幻想」の問題に対し、双アンカー型ポリシー蒸留(DAPD)手法を提案し、その有効性を示した。