ページを読み込み中…
1件の記事
Hugging Face Daily Papers が紹介した研究で、コーディングエージェントの強化学習における環境不整合や報酬ハッキングの問題を解決する新フレームワーク「LEGO-RL」が提案された。