Hugging Face、エージェント学習用環境生成ツール「EnvHarness」を発表
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
LLM エージェントの学習環境を動的に再構築する「EnvHarness」と、エージェントの弱点を検出して自動生成する「EnvRigger」が発表され、既存手法を上回る性能向上を実現した。
AI深層分析を開く2026年8月21日 11:35
AI深層分析
キーポイント
静的環境の課題解決
従来の学習環境は手動構築で静的であり、エージェントの成長に合わせて陳腐化する問題点を指摘し、これを解消するアプローチを提案している。
EnvHarness の機能
既存の環境ロジックを変更せず、プラグインコンポーネント層を介して動作を再構築できる「EnvHarness」を提案し、検証器を維持したまま多様なドメインに対応可能とした。
EnvRigger の自動化
ターゲットポリシーをブラックボックスとして扱い、実行軌跡を観測して欠陥を検出し、新しい環境コンポーネントを自動合成する「EnvRigger」を導入した。
重要な引用
we propose Environment Harness (EnvHarness), a programmable layer of plug-in components that wraps a static environment to reshape its behavior without modifying the underlying logic
to automate this process, we introduce EnvRigger, which treats the target policy as a black box, observing its execution trajectories to synthesize EnvHarness components targeting diagnosed flaws
編集コメントを表示
編集コメント
エージェント学習における環境の「陳腐化」という本質的な課題に対し、既存ロジックを壊さずに動的に再構築するアプローチは実用性が極めて高い。特に「EnvRigger」による自動化機能は、大規模な実験や継続的学習の現場において開発コストを大幅に削減する可能性を秘めている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
LLM エージェントは環境との相互作用を通じて学習しますが、現在の環境は手作業で構築された静的なものであり、エージェントの弱点を見逃しやすく、能力が向上してもすぐに陳腐化してしまいます。最近の環境生成手法はこの課題に対処しようとしていますが、ドメイン固有のパイプラインを必要とし、高価または信頼性の低い検証器に依存しており、依然として静的な環境しか生成できません。
これらの課題を解消するため、私たちは「Environment Harness(EnvHarness)」を提案します。これは静的な環境をラップして、基盤となるロジックを変更せずにその動作を再構築するための、プラグインコンポーネントからなるプログラム可能なレイヤーです。標準インターフェースを通じて動作する EnvHarness は多様なドメインに適用可能でありながら、すべての再構築された環境が元の検証器を保持することを保証します。
このプロセスを自動化するために、「EnvRigger」を導入しました。これはターゲットポリシーをブラックボックスとして扱い、その実行軌跡を観測することで診断された欠陥を対象とした EnvHarness コンポーネントを合成し、新たなロールアウトを通じてそれらを検証します。4 つのドメインにおける 5 つのベンチマークで、EnvHarness は元の環境やドメイン固有の環境生成パイプラインを上回り、未学習インスタンスでは最大 9.0 ポイントの改善を実現しました。また、実行ステップ数は 9.8% 削減されています。
さらに、EnvHarness は強化学習に対して優れた最適化シグナルを提供し、ポリシーとその環境が継続的かつ標的に合わせた共進化を可能にします。
原文を表示
LLM agents learn by interacting with environments, yet these environments are hand-built and static: blind to an agent's weaknesses, and quickly left behind as it improves. While recent environment generation methods attempt to address this, they require domain-specific pipelines, rely on expensive or unreliable verifiers, and still produce static environments. To alleviate the engineering burden of rebuilding environments from scratch, we propose Environment Harness (EnvHarness), a programmable layer of plug-in components that wraps a static environment to reshape its behavior without modifying the underlying logic. Operating through standard interfaces, EnvHarness applies across diverse domains while ensuring every reshaped environment retains its original verifier. To automate this process, we introduce EnvRigger, which treats the target policy as a black box, observing its execution trajectories to synthesize EnvHarness components targeting diagnosed flaws, and validating them via fresh rollouts. Across five benchmarks in four domains, EnvHarness outperforms both original environments and domain-specific environment generation pipelines, achieving up to a 9.0-point improvement on held-out instances with 9.8% fewer execution steps. Furthermore, EnvHarness provides a superior optimization signal for reinforcement learning, enabling continuous, targeted co-evolution of the policy and its environment.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み