Hugging Face、複雑な環境下でのエージェント学習向け黒箱 RL 枠組み「ClawGym II」を発表
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
研究チームは複雑な環境ハッチスでの長期タスク実行を可能にする統合型ブラックボックス強化学習フレームワーク「ClawGym II」を発表し、Qwen3-30A3Bモデルを用いてベンチマークで大幅な性能向上を実現した。
AI深層分析を開く2026年8月18日 13:25
AI深層分析
キーポイント
サンドボックス基盤の構築
タスク環境とハッチスを一時サンドボックス内に隔離し、大規模な並列ロールアウトを可能にする実行インフラストラクチャを構築した。
ポリシー最適化の分離手法
モデル境界にサービングプロキシを設置してモデル呼び出しを捕捉し、不透明なハッチス実行からポリシー最適化を分離する仕組みを採用した。
効率向上のための構造変換
捕捉した呼び出しを接頭辞木構造に整理することで多ターン軌道を再構築し、Critic-based PPOとCritic-free GRPOの両方を最適化対象とした。
混合ハッチストレーニング
単一モデルが異種ハッチスによって同時に最適化される「mix-harness training」を導入し、訓練と推論の一貫性を維持した。
重要な引用
we present a unified black-box RL framework for stable and scalable optimization of general agents through complex harnesses
black-box RL improves Pass@1 on ClawGym-Bench by 9.98 and 14.81 points through OpenClaw and Claude Code, respectively
the framework yields consistent gains on more challenging tasks such as JobBench and OfficeQA
編集コメントを表示
編集コメント
この研究は、複雑な外部環境と連携するエージェントの学習におけるボトルネックを解消する画期的なアプローチを示している。特に異なるハッチスシステム間での統一トレーニングが可能になる点は、実世界での汎用性向上に大きく寄与する。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
エージェント・ハーネスは、環境との相互作用を調整することで長期タスクの性能を大幅に向上させてきました。しかし、複雑なハーネスを通じた強化学習はまだほとんど探求されておらず、そのようなトレーニングを長期のエージェント・タスクにスケールさせることは根本的な課題をもたらします。
本研究では、複雑なハーネスを通じて汎用的なエージェントを安定かつスケーラブルに最適化するための統一されたブラックボックス RL フレームワークを提案します。具体的にはまず、大規模な同時ロールアウトのためにタスク環境とハーネスを一時的なサンドボックス内に隔離する実行基盤を構築します。次に、ポリシー最適化を不透明なハーネスの実行から分離し、モデル境界にサービング・プロキシを設置してモデルの呼び出しをキャプチャします。
多ターン軌道の再構成とトレーニング効率の向上のため、キャプチャした呼び出しを接頭辞木構造(prefix trees)に整理し、回復された木構造上で最適化するために、批評家ベースの PPO と批評家不要の GRPO の両方を適応させます。同時に、最適化プロセス全体を通じてトレーニングと推論の一貫性を維持します。
最後に、ミックス・ハーネス・トレーニングを導入しました。これにより、単一のモデルを異種多様なハーネスによって共同で最適化することが可能になります。
Qwen3-30A3B を用いた実験では、OpenClaw と Claude Code によるブラックボックス RL は、それぞれ ClawGym-Bench の Pass@1 を 9.98 ポイント、14.81 ポイント向上させました。また、200〜400 ステップの最適化ステップにわたって安定した性能を維持しています。
さらに、本フレームワークは JobBench や OfficeQA といったより困難なタスクにおいても一貫した性能向上をもたらします。全体として、このフレームワークにより、異種の実行システムにまたがる統合トレーニングを可能にし、ブラックボックス・ハーネスを通じて汎用エージェントの効果的かつ安定したスケーラブルな最適化を実現できます。
原文を表示
Agent harnesses have substantially improved performance on long-horizon tasks by coordinating agent interactions with the environment. However, reinforcement learning through complex harnesses remains largely unexplored, as scaling such training to long-horizon agent tasks introduces fundamental challenges. In this work, we present a unified black-box RL framework for stable and scalable optimization of general agents through complex harnesses. Concretely, we first build a sandbox-based execution infrastructure that isolates task environments and harnesses within temporary sandboxes for large-scale concurrent rollouts. We then decouple policy optimization from opaque harness execution and place a serving proxy at the model boundary to capture model calls. To reconstruct multi-turn trajectories and improve training efficiency, we organize the captured calls into prefix trees and further adapt both critic-based PPO and critic-free GRPO to optimize over the recovered tree structure. Meanwhile, we maintain training-inference consistency throughout the optimization process. Finally, we introduce mix-harness training, allowing a single model to be jointly optimized by heterogeneous harnesses. With Qwen3-30A3B, black-box RL improves Pass@1 on ClawGym-Bench by 9.98 and 14.81 points through OpenClaw and Claude Code, respectively, while remaining stable over 200-400 optimization steps. Moreover, the framework yields consistent gains on more challenging tasks such as JobBench and OfficeQA. Overall, our framework enables effective, stable, and scalable optimization of general agents through black-box harnesses, supporting unified training across heterogeneous execution systems.
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み