Hugging Face、エージェント強化学習にガウスガイダンスを提案する論文「Agent-G^2」を発表
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
研究者らは、長期的なエージェントタスクにおける報酬の希薄化問題を解決するため、ガイダンス深度をガウス分布としてオンライン推定する「Agent-G^2」フレームワークを提案し、既存手法を上回る性能とコスト効率を示した。
AI深層分析を開く2026年8月28日 12:40
AI深層分析
キーポイント
ガイダンス深度の確率的アプローチ
既存手法が単一の最適値やスカラー値に依存するのに対し、有用なガイダンスは中心を基準としたガウス分布の帯域上に存在すると特定し、その深さを確率変数として扱う。
不要なプローブロールアウトの排除
収集済みのロールアウトデータからオンラインで推定を行うことで、深度を個別に推測するための追加ロールアウトや学習済み予測器を一切必要としない仕組みを実現した。
実験環境での性能向上証明
ALFWorldおよびWebShopにおけるQwen2.5-1.5B/7B-Instructモデルの評価で、既存のヒントベース・フリー・補助強化学習手法を大幅に上回るスコアを獲得した。
計算コストの劇的削減
サンプルごとのプローブ手法と比較してロールアウトコストが3分の1以下でありながら、2.3〜7.4ポイントという高い性能向上を達成している。
重要な引用
useful guidance occupies a band of depths whose informativeness profile is approximately Gaussian around the band center
requiring no probe rollouts or learned depth predictor
Agent-G^2 outperforms the strongest hint-based, hint-free, and Aux-RL baselines on ALFWorld by 2.3 / 3.9 / 7.4 points
編集コメントを表示
編集コメント
本稿は、既存のヒントベース手法の限界を克服する画期的なアプローチを示しており、実用化に向けた計算コスト削減という観点で非常に価値が高い。特に追加ロールアウトが不要である点は、大規模モデルの実行環境において即座に適用可能な利点と言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
ヒント付き強化学習は、長期のエージェントタスクにおける報酬の希薄化問題に対処するため、各ロールアウト前に専門家による軌道の先頭部分を保持し、成功に近い状態から方策が探索を開始する仕組みです。その効果は「ガイダンス深度」、つまりどの程度の軌道情報を保持するかにかかっています。
既存手法はこの深度を決定論的なスカラー値として扱います。スケジュール型アプローチではサンプル間で一つの値を共有するためタスクごとの多様性を無視し、サンプルごとにプローブを行う方式では追加のロールアウトが必要となるコストがかかります。
我々の調査により、有用なガイダンスは単一の最適点に集中するのではなく、ある深さの帯域(バンド)に存在することがわかりました。この帯域内の情報量は中心付近でガウス分布に近いプロファイルを示します。
そこで提案するのが Agent-G^2 です。これはタスクごとに深度をガウス分布からサンプリングするガイダンスフレームワークです。その平均と分散は、方策最適化のために既に収集されたロールアウトデータからオンラインで推定されます。プローブ用のロールアウトや学習済みの深度予測モデルは不要です。
この手法では、中心値が「グローバルなベースライン」と「クラスタごとの難易度」の組み合わせで構成され、分散がクラスタ内のばらつきを追跡します。
Agent-G^2 は Qwen2.5-1.5B / 7B-Instruct を用いて ALFWorld と WebShop で評価されました。ALFWorld では、既存の最強のヒント付き手法、ヒントなし手法、および Aux-RL ベースラインをそれぞれ 2.3 / 3.9 / 7.4 ポイント上回りました。また、サンプルごとのプローブ方式と比較してロールアウトコストは約 1/3 で済みました。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み