最小 GPU で長期推論 LLM エージェントを学習する手法「Agentic ESOpt」
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
本研究は、長期的なエージェント推論における強化学習の課題を解決するため、進化戦略(ES)を活用した「Agentic ESOpt」フレームワークを提案し、大規模モデルでも低GPU メモリで微調整が可能であることを実証する。
AI深層分析を開く2026年8月19日 15:35
AI深層分析
キーポイント
進化戦略によるスケーラビリティの向上
重厚な逆伝播ベースのトレーニングスタックに依存しないため、最小限の推論用 GPU メモリで全パラメータ最適化が可能となり、大規模 LLM の微調整が現実的なものとなる。
柔軟なフィードバックインターフェース
軽量なブラックボックス型フィードバックインターフェースを採用することで、プロンプト空間の進化(スキル最適化やテスト時計算)との組み合わせが容易になる。
長期ホライズンでの信用配分の改善
報酬を時間軸に分解せず、軌道レベルのパラメータ帰属を行うことで、ホライズンが長くなるほど強化学習よりも優れたスケーラビリティを発揮する。
探索と適応のバランス最適化
摂動スケールσの余弦減衰スケジュールを導入し、探索と適応のトレードオフを改善して性能向上を図る仕組みを採用している。
重要な引用
ES offers three key advantages: 1) Model Scalability...
full-parameter optimization of Qwen-3.5-27B improves the No Skill baseline by 6.69%
Agentic ESOpt performs online prompt--parameter co-evolution, improving its matched baseline in 28 of 36 settings
編集コメントを表示
編集コメント
長期的な推論タスクにおける計算コストの壁を、進化戦略という異なるアプローチで打破する試みは非常に興味深い。特に大規模モデルでも低メモリで動作する点は、実運用環境での導入可能性を高める重要な要素である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
強化学習(RL)は、単発の LLM 微調整において有望な成果を示してきました。しかし、長期にわたるエージェント推論では相互作用が枝分かれし、報酬も希薄になるため、RL のいくつかの限界が浮き彫りになります。重厚な逆伝播ベースの学習スタックにより大規模 LLM を微調整するのが現実的ではないこと、そして長期の軌道(trajectories)によって RL における帰属問題(credit assignment)が大幅に困難になることがその例です。
本論文は、進化戦略(ES)が長期 LLM エージェントの微調整にはより適した選択肢であると主張します。エージェント型 RL と比較して、ES には 3 つの主要な利点があります。1つ目はモデルのスケーラビリティです。ES は推論レベルの最小限の GPU メモリで全パラメータ最適化を可能にし、大規模 LLM の微調整を実現します。2つ目の利点は柔軟性です。軽量なブラックボックスフィードバックインターフェースにより、プロンプト空間の進化(スキル最適化やテスト時の計算など)と ES 微調整を組み合わせて容易に適用できます。3つ目は長期スケーラビリティです。ES は報酬を時間軸で分解することなく、軌道レベルでのパラメータ帰属を実行するため、時間軸が長くなるほどエージェント型 RL よりも優れたスケーラビリティを発揮します。
これらの洞察に基づき、我々は「Agentic ESOpt」を提案しました。これは柔軟なパラメータとコンテキストの共進化に特化した全パラメータ型エージェント微調整フレームワークです。各ステップで、Agentic ESOpt は現在の LLM パラメータ周辺に変動(perturbations)をサンプリングし、生成されたエージェントを報酬で評価した上で、オンライン報酬加重更新を適用します。
探索と適応のトレードオフを改善するため、Agentic ESOpt はさらに摂動スケールσに対するコサイン減衰スケジュールを導入しています。WebArena-Lite において、Qwen-3.5-27B の全パラメータ最適化により、No Skill ベースラインから 6.69% の向上が達成されました。テスト時の自動ヒューリスティック設計では、Agentic ESOpt がオンラインでのプロンプトとパラメータの共進化を実現し、36 の設定のうち 28 で対応するベースラインを上回りました。
原文を表示
Reinforcement Learning (RL) has been promising in single-turn LLM fine-tuning. However, long-horizon agentic reasoning introduces increasingly branching interactions and sparse rewards, exposing several limitations of RL: its heavyweight backpropagation-based training stack makes it impractical to fine-tune larger LLMs, and longer-horizon trajectories make credit assignment in RL substantially harder. This paper argues that evolution strategies (ES) can be a better choice for fine-tuning long-horizon LLM agents. Compared with agentic RL, ES offers three key advantages: 1) Model Scalability: ES enables full-parameter optimization with only minimal, inference-level GPU memory, making it possible to fine-tune large LLMs. 2) Flexibility: its lightweight, black-box feedback interface makes ES fine-tuning easy to compose with prompt-space evolution (e.g., skill optimization & test-time compute); and 3) Long-Horizon Scalability: ES performs trajectory-level parameter attribution without decomposing rewards across horizons, yielding better scalability than Agentic RL as the horizon length grows. Based on this insight, we propose Agentic ESOpt, a full-parameter agentic fine-tuning framework tailored to flexible parameter--context co-evolution. At each step, Agentic ESOpt samples perturbations around the current LLM parameters, evaluates the resulting agents with rewards, and applies an online reward-weighted update. To improve the exploration--adaptation trade-off, Agentic ESOpt further introduces a cosine decay schedule of the perturbation scale σ. On WebArena-Lite, full-parameter optimization of Qwen-3.5-27B improves the No Skill baseline by 6.69%. In test-time automatic heuristic design, Agentic ESOpt performs online prompt--parameter co-evolution, improving its matched baseline in 28 of 36 settings.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み