大規模言語モデルの多タスク学習における SFT と RL の分析
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
大規模言語モデルの多タスク学習において、SFT が深刻なタスク競合を引き起こす一方、RL はパラメータ更新が疎で直交する性質を持つことを理論・実証的に解明し、効率的な並列 RL パラダイムを提案した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月11日 03:01
AI深層分析
キーポイント
SFT と RL の挙動の根本的差異
多段階トレーニング下では SFT が深刻なタスク競合に陥るが、RL は多様なタスク間で安定して共存できることが実験で確認された。
パラメータレベルでの原因解明
RL はタスク間において疎かつほぼ直交する更新を引き起こし、これが安定性の源泉であることがパラメータレベルで特定された。
競合の理論的メカニズムの対比
SFT の干渉は勾配絶対値に比例して拡大するノルム制限型であるが、RL はアドバンテージ正規化とオンポリシー最適化による分散制限型であり、これが直交方向を生む。
並列 RL パラダイムの提案
上記の知見に基づき、多タスクトレーニングを解耦する「Parallel-RL」を提案し、効率性と柔軟性を大幅に向上させることを示した。
重要な引用
SFT suffers from severe task conflicts under multi-stage training, whereas RL enables stable coexistence across diverse tasks.
interference in SFT is norm-limited, scaling with the absolute gradient magnitude, whereas interference in RL is variance-limited
This small variance bound yields near-orthogonal optimization directions across tasks.
編集コメントを表示
編集コメント
SFT と RL の競合メカニズムを勾配の性質から理論的に解明した点は、実務におけるハイパーパラメータ調整やアーキテクチャ設計に大きな示唆を与える。特に「分散制限」という概念は、既存の学習手法の限界を超えるための新たな視点として注目されるべきである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
大規模言語モデル(LLM)におけるマルチタスク推論の強化において、教師あり微調整(SFT)と強化学習(RL)は根本的に異なる振る舞いを示します。予備実験で確認された現象とは、SFT は多段階トレーニング下で深刻なタスク競合に陥る一方、RL は多様なタスク間で安定した共存を可能にする点です。
この違いの要因を実証的に追跡すると、パラメータレベルでの挙動にその理由が見えてきます。具体的には、RL がタスク間においてスパースでほぼ直交する更新を引き起こすことが観察されます。私たちはマルチタスク勾配干渉を分析することで、このメカニズムに対する理論的説明を提供します。
結果として明確になったのは、SFT と RL における干渉の性質の違いです。SFT での干渉はノルムに制限され、絶対的な勾配の大きさに比例して拡大しますが、RL での干渉は分散に制限されます。これは、アドバンテージ正規化とオンポリシー最適化によって誘発される勾配の分散によって制約されるためです。
この小さな分散バウンドが、タスク間でほぼ直交する最適化方向を生み出します。この知見に基づき、マルチタスクトレーニングを分離するパラダイム「Parallel-RL」を提案します。これにより、効率性と柔軟性が大幅に向上します。
原文を表示
Supervised Fine-Tuning (SFT) and Reinforcement Learning (RL) exhibit fundamentally different behaviors in enhancing multi-task reasoning for large language models (LLMs). Our preliminary experiments revealed a phenomenon: SFT suffers from severe task conflicts under multi-stage training, whereas RL enables stable coexistence across diverse tasks. Empirically, we trace this to the parameter level, observing that RL induces sparse and approximately orthogonal updates across tasks. We provide a theoretical explanation for this mechanism by analyzing multi-task gradient interference. Our results reveal a distinction: interference in SFT is norm-limited, scaling with the absolute gradient magnitude, whereas interference in RL is variance-limited, bounded by the gradient variance induced by advantage normalization and on-policy optimization. This small variance bound yields near-orthogonal optimization directions across tasks. Leveraging this insight, we propose Parallel-RL, a paradigm that decouples multi-task training, significantly improving efficiency and flexibility.
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み