ページを読み込み中…
1件の記事
Hugging Face は、言語・視覚言語モデルの推論能力向上を目指す強化学習において、正解ラベルに依存しない自己報酬型アプローチとして「Co-RL」を発表し、多様なエージェント集団から教師なしで推論が創発することを示した。