ページを読み込み中…
1件の記事
本研究は、評価(evals)を学習信号として用い、エージェントのハルクライミングにより「Better Harness」を反復的に構築・改善するシステムを紹介する。この手法は、エージェントの過学習を防ぎ、一般化能力を高める設計決定を含む。