コーディングエージェント向け学習フレームワーク「LEGO-RL」を公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
LEGO-RL は、既存のコーディングエージェント用ハッシュを内部制御フローを変更せずに強化し、環境クラッシュや報酬ハッキングによる信号の歪みを解消する新しい強化学習フレームワークである。
AI深層分析を開く2026年8月21日 15:31
AI深層分析
キーポイント
ネイティブ環境との互換性維持
既存のコーディングエージェント用ハッシュの内部制御フローを変更することなく、スケーラブルなポリシー勾配最適化を可能にするフレームワークである。
忠実な最適化の実現
プロセス内 LLM プロキシによる生成ストリームのキャプチャと、ハッシュ側の圧縮や再シリアライズ下でも機能するロジック確率の再計算により、トークンレベルのアラインメントを実現する。
信頼性の高い実行環境
スケーラブルなサンドボックスオーケストレーションにイメージキャッシングと段階的な防御機構を組み込み、報酬ハッキングを緩和して実行の信頼性を高める。
可視化されたトレーニング
自動検証・監視を行う統合プラグインと、詳細な軌跡診断を可能にするライブ UI を提供し、トレーニングプロセスの可観測性を確保する。
重要な引用
LEGO-RL is a framework that bridges native coding-agent harnesses with scalable policy-gradient optimization without modifying their internal control flow.
faithful optimization via in-process LLM proxying that captures raw generation streams for token-level alignment
reliable execution via scalable sandbox orchestration featuring image caching and stage-wise defenses to mitigate reward hacking
編集コメントを表示
編集コメント
既存のインフラを破壊せずに学習効率を高めるアプローチは、実務現場での導入障壁を下げ、コーディングエージェントの実用化スピードを加速させる可能性が高い。特に Qwen3.5-35B-A3B のような大規模モデルにおける性能向上は、今後のエージェント開発の標準的なベストプラクティスとなるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
コーディングエージェントにおける強化学習は、ツール統合やリポジトリの文脈管理、実行フィードバックを処理するために、長時間稼働するエージェントハネスに依存する傾向が強まっています。しかし、これらのハネスが提供するネイティブな実行環境は、ポリシー勾配学習のトレーニングと本質的に整合していません。環境クラッシュや報酬ハッキングによって成果信号が歪められたり、トレーニングと推論の乖離によりロールアウト行動がポリシー更新から切り離されたりする問題があります。
これらに対処するため、私たちは「LEGO-RL」というフレームワークを発表しました。これは、ネイティブなコーディングエージェントハネスのスケーラブルなポリシー勾配最適化を、内部制御フローを変更することなく橋渡しするものです。LEGO-RL は以下の 3 つの柱の上に構築されています。
1つ目は、プロセス内 LLM プロキシによる忠実な最適化です。これにより、ハネス側での圧縮や再シリアライズが行われていても、生の生成ストリームをキャプチャしてトークンレベルの整合性を保ち、トレーナー側で対数尤度の再計算を可能にします。
2つ目は、スケーラブルなサンドボックスオーケストレーションによる信頼性の高い実行です。イメージキャッシュと段階的な防御機構を備え、報酬ハッキングの影響を軽減します。
3つ目は、統合プラグインによる可視化可能なトレーニングです。このプラグインは検証と監視を自動化し、詳細な軌跡診断のためのライブ UI と連携します。
LEGO-RL の評価では、スプース MoE モデル「Qwen3.5-35B-A3B」を 3 つの異なるネイティブコーディングエージェントハネスで GSPO を用いてトレーニングしました。
LEGO-RL は、SWE-bench Verified 上での Qwen3.5-35B-A3B の性能を向上させます。OpenHands SDK では 64.0% から 70.4% に、Claude Code では 62.4% から 68.2% に、そして OpenCode では 57.2% から 66.6% にそれぞれ引き上げました。この改善は、ロールアウト訓練の相関が 0.99 を上回る状態を維持したまま達成されています。
原文を表示
Reinforcement learning for coding agents increasingly relies on long-running agent harnesses to manage tool integration, repository contexts, and execution feedback. However, the native execution environments of these harnesses are inherently misaligned with policy-gradient training: environmental crashes and reward hacking corrupt outcome signals, while train-inference discrepancies decouple rollout behavior from policy updates. To address this, we present LEGO-RL, a framework that bridges native coding-agent harnesses with scalable policy-gradient optimization without modifying their internal control flow. LEGO-RL is built upon three pillars: (1) faithful optimization via in-process LLM proxying that captures raw generation streams for token-level alignment and robust trainer-side log-probability recomputation, even under harness-side compaction or re-serialization; (2) reliable execution via scalable sandbox orchestration featuring image caching and stage-wise defenses to mitigate reward hacking; and (3) observable training through an integrated plugin that automates validation and monitoring, paired with a Live UI for granular trajectory diagnostics. We evaluate LEGO-RL by training the sparse MoE model Qwen3.5-35B-A3B with GSPO across three native coding-agent harnesses. LEGO-RL improves Qwen3.5-35B-A3B across OpenHands SDK (64.0% to 70.4%), Claude Code (62.4% to 68.2%), and OpenCode (57.2% to 66.6%) on SWE-bench Verified, while maintaining a rollout-training probability correlation above 0.99.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み