GSPO:言語モデル向けスケーラブル強化学習へ向けて
著者らは、大規模言語モデルの強化学習で既存手法が長期訓練時に崩壊する問題を解決するため、安定なスケーラブル強化学習手法「GSPO」を提案する。
PAPER DISCORD
導入 強化学習(Reinforcement Learning)は、言語モデルのスケール化と、その深い推論能力や問題解決能力の向上において中核的なパラダイムとして台頭しています。強化学習をスケールさせるための最優先の前提条件は、安定した堅牢なトレーニング動態を維持することです。しかし、既存の強化学習アルゴリズム(GRPO など)は、長期トレーニング中に深刻な不安定性を示し、不可逆的なモデル崩壊を引き起こすことが観察されています。これは計算リソースを増やしてもさらなる性能向上を阻害する要因となっています。
成功した強化学習のスケール化を実現するために、私たちはグループシーケンスポリシー最適化(Group Sequence Policy Optimization: GSPO)アルゴリズムを提案します。
原文を表示
PAPER DISCORD
Introduction Reinforcement Learning (RL) has emerged as a pivotal paradigm for scaling language models and enhancing their deep reasoning and problem-solving capabilities. To scale RL, the foremost prerequisite is maintaining stable and robust training dynamics. However, we observe that existing RL algorithms (such as GRPO) exhibit severe instability issues during long training and lead to irreversible model collapse, hindering further performance improvements with increased compute.
To enable successful RL scaling, we propose the Group Sequence Policy Optimization (GSPO) algorithm.
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み