大規模・長文コンテキスト RL 後学習におけるオンラインドラフト共訓練の提案
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
NVIDIA は大規模・長文脈 RL 後学習における推論コスト削減のため、オンライン共同トレーニングシステムを提案し、122B モデルや 256K トークンでの高速化とメモリ効率向上を実現した。
AI深層分析を開く2026年9月9日 19:11
AI深層分析
キーポイント
大規模・長文脈への拡張課題の解決
標準的な因果コンテキスト並列(CP)実装ではサポートされていないブランチアテンションや、パイプライン並列(PP)ステージにまたがるターゲット特徴という2つの障壁を克服する。
CP 設計における新しいアプローチ
ランクローカルのブランチアテンションと因果メインシーケンスアテンションを統合し、パケット化された負荷分散ジグザグリングアテンションを拡張することで実装した。
PP 設計における特徴量転送
TapChannel を用いて中間ターゲット特徴量を別経路でステージ間転送し、パイプラインスケジュールへの影響を最小限に抑えた。
実験結果による性能確認
共同トレーニングされたドラフトはポリシーベースラインに密接に追従しつつ、122B モデル規模までで推論とエンドツーエンドの大幅な高速化を実現した。
重要な引用
Speculative decoding accelerates rollout generation, which dominates the cost of reinforcement learning (RL) post-training.
Our CP design achieves strong scaling at 256K tokens with significant memory savings over prior work
Experiments demonstrate that co-trained drafts closely track the policy baseline while delivering substantial rollout and end-to-end speedups across model scales up to 122B.
編集コメントを表示
編集コメント
この論文は、大規模モデルの学習コストを支配する推論段階のボトルネックに対して、システムレベルでの革新的な解決策を示している。NVIDIA-NeMo の実装が公開されることで、研究コミュニティや産業界における大規模 RL トレーニングの実践的なハードルが下がる可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
推測デコーディングは、リインフォースメント・ラーニング(RL)ポストトレーニングの主要なコストとなるロールアウト生成を加速します。オンライン共学習によりドラフトの精度をさらに高め、より大きな速度向上を実現できます。しかし、大規模モデルと長いコンテキストでの共学習にこのアプローチをスケールさせるには、2 つの障壁があります。(1) 標準的な因果性コンテキスト・パラレル(CP)実装ではブランチアテンションがサポートされていないこと、(2) ターゲット特徴量がパイプライン・パラレル(PP)ステージ全体にまたがることです。私たちはこれら両方の課題に対処し、大規模なオンラインドラフト共学習のためのエンドツーエンドシステムを構築しました。
CP については、ランクローカルのブランチアテンションと因果性のメインシーケンスアテンションを統合することで、パッキングされ負荷分散されたジグザグリングアテンションを拡張します。PP については、TapChannel が中間ターゲット特徴量を別経路でステージ間転送し、パイプラインスケジュールへの影響を防ぎます。
実験結果では、共学習されたドラフトはポリシーベースラインに密接に追従しつつ、122B モデル規模までの幅広いモデルサイズでロールアウトとエンドツーエンドの速度向上を大幅にもたらすことが示されました。私たちの CP 設計は、先行研究と比較してメモリ使用量を大幅に削減しながら、256K トークンでの強力なスケーリングを実現します。また、PP の転送によるオーバーヘッドも限定的です。
コードは https://github.com/NVIDIA-NeMo/RL/issues/3698 で公開されています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み