ページを読み込み中…
1件の記事
Hugging Face が、オープンエンド領域における大規模言語モデルの学習課題に対し、生徒モデルの性能に応じて変化する文脈を用いたオンポリシー蒸留手法「Flux-OPD」を提案し、その不安定性を解消するメカニズムを示した。