Z.ai の安定した非同期強化学習(13 分読了)
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Z.ai は、既存の非同期強化学習の不安定性を解決する「Single-rollout Asynchronous Optimization (SAO)」を提案し、GLM-5.2 モデルの訓練に成功した。
AI深層分析を開く2026年8月6日 19:13
AI深層分析
キーポイント
単一ロールアウトによるオフポリシー効果の低減
既存の GRPO フレームワークが抱えるグループサンプリングの問題を解決するため、1 つのプロンプトに対して 1 つのロールアウトを使用する戦略を採用した。
厳格なトークンレベルクリッピングの実装
最適化の安定性を確保するために、双方向の厳格なトークンレベルクリッピング戦略を導入し、千ステップにわたる安定した訓練を可能にした。
GLM-5.2 モデルへの実装成功
SAO は 750B-A40B の構成を持つ GLM-5.2 オープンモデルの訓練パイプラインに実際に展開され、コード生成や推論ベンチマークで GRPO を上回る性能を発揮した。
動的環境への適応能力の実証
シミュレーションされたオンライン学習設定において、変化する環境に適応する必要があるタスクで単一ロールアウト強化学習が特に効果的であることを示した。
重要な引用
SAO is able to train stably for one thousand steps and consistently outperform GRPO and its variants on agentic coding and reasoning benchmarks
To reduce off-policy effects and improve generalization, we replace group-wise sampling with single-rollout sampling
編集コメントを表示
編集コメント
既存の同期型パイプラインに依存しない非同期学習の実用化は、大規模モデル訓練の効率化において重要な転換点となる。特に GLM-5.2 のような巨大パラメータモデルでの成功事例は、今後の研究開発における標準的なアプローチの一つになり得る。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Z.ai の安定した非同期強化学習(13 分読了)
要旨:強化学習(RL)は、大規模言語モデル(LLM)のポストトレーニングにおいて重要性を増しています。これまでの LLM 向け RL パイプラインは主に同期型でバッチ間隔処理が主流でしたが、これは長期にわたるエージェントタスクには非効率的です。最近では、ロールアウトが到着するたびにモデルを更新する「非同期 RL」がより効率的な代替手段として注目されています。しかし既存の非同期 RL システムはスループットを重視する傾向があり、トレーニングの安定性やタスクの実効性については十分に探求されていませんでした。例えば、広く使われている GRPO フレームワークにおけるグループごとのサンプリングは、非同期型エージェント学習には自然に適合しません。
本稿では、非同期 RL の安定性とオフポリシー(学習データ分布と行動分布の不一致)の問題に対処する「シングルロールアウト非同期最適化(SAO)」を提案します。オフポリシー効果の低減と汎化性能の向上を図るため、グループごとのサンプリングに代わり、1 つのプロンプトに対して 1 つのロールアウトのみを使用するシングルロールアウト・サンプリングを採用しました。さらにこの戦略を実用的な価値モデル(Value Model)の学習設計によって強化しています。
最適化の安定性を高めるために、厳格なダブルサイド・トークンレベルのクリッピング手法を導入しました。SAO は 1000 ステップにわたって安定して訓練可能であり、SWE-Bench Verified、BeyondAIME、IMOAnswerBench といったエージェント向けコーディングおよび推論ベンチマークにおいて、GRPO およびその派生モデルを一貫して上回る性能を示します。
また、単一ロールアウトの強化学習(RL)が、モデルが変化する環境に適応する必要があるシミュレーション上のオンライン学習設定において特に効果的であることを実証しました。これを実現するため、SAO はオープンソースの GLM-5.2 モデル(750B-A40B)を訓練するためのエージェント型 RL パイプラインに成功裡に導入されました。
| 対象: | 機械学習 (cs.LG); 人工知能 (cs.AI) |
|---|---|
| 引用形式: | arXiv:2607.07508 [cs.LG] |
| (またはこのバージョンは arXiv:2607.07508v1 [cs.LG]) | |
| https://doi.org/10.48550/arXiv.2607.07508 arXiv発行のDOI (DataCite経由) |
提出履歴
送信者:Zhenyu Hou [メールを表示] [v1]
2026年7月8日水曜日 15:02:19 UTC (341 KB)
AI算出
技術分析ainew評価高い
Z.ai が発表した新しい非同期強化学習手法「SAO」は、GRPOなどの既存手法に対する明確な技術的改善であり、実装アプローチやベンチマーク結果が具体的に記述されているため、技術分析として分類します。日本企業との直接的な関連性は薄いものの、AI 研究の重要な進展であるため高評価としました。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み