ページを読み込み中…
1件の記事
自律型エージェントが長期実験を通じてモデルやシステムを改善する能力について、最終スコアだけでなく進捗の所在や経験の蓄積効果を検証する新しい評価フレームワークを提案し、7 つの最先端モデルを対象に 36 の長期タスクで体系的に評価した。