オンポリシー蒸留の信頼性検証:教師ノイズと自己改善の実態分析
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Hugging Face Daily Papers は、オンポリシー蒸留(OPD)における教師による学生生成軌道の評価に大きなノイズが存在し、その信頼性と学生の改善源が不明確であることを定量的に分析した。
AI深層分析を開く2026年9月1日 15:40
AI深層分析
キーポイント
On-policy Distillation のノイズと実態
教師モデルが生成する軌道は本質的にオフポリシーであり、その監督にはスケールに比例して増大するノイズが含まれる。しかし学生モデルはこのノイズに対して不感で、教師の指導の有無に関わらず同程度の性能へ収束することが判明した。
学習メカニズムの解明
On-policy Distillation の効果は主に低対数確率トークンの抑制に起因しており、教師が提供する複雑な信号ではなく単一の固定負の利得でも同等の性能が達成可能である。
On-Policy Self-Adaptation (OPSA) の提案
教師を不要とする新手法 OPSA が提案され、エントロピー適応型負の利得を用いて高エントロピー位置に強い学習信号を与え、確率質量を再分配する。
実験結果と性能向上
Qwen3-1.7B ベースモデルに対して OPSA を適用した結果、AIME24 で Avg@32 が 35.41 ポイント(相対 263%)向上し、既存の OPD 手法も上回る性能を示した。
重要な引用
learning concentrates on low log-probability tokens
OPSA improves Avg@32 by 35.41 points on AIME24, corresponding to a 263% relative gain
This suggests that OPD works largely by suppressing low log-probability tokens, which requires no teacher
編集コメントを表示
編集コメント
教師モデルのノイズが学習に与える影響を定量的に分析し、その本質的なメカニズムを抽出した点は非常に示唆に富む。Qwen ベースでの実験結果は、リソース制約下でも高性能化が可能であることを強く示しており、実装への応用期待が高まる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
オンポリシー蒸留(OPD)は、検証可能な報酬を持つ強化学習(RLVR)が持つ希薄な結果レベルの代替手段として、密なトークンレベルの監督を提供します。しかし、教師モデルが生徒モデルが生成した軌跡を評価する際、その軌跡は教師にとって本質的にオンポリシーではないため、その監督の信頼性や、生徒モデルの改善源がどこにあるのかは依然として不明瞭です。
私たちは OPD 訓練中の教師による監督を定量的に分析し、そのノイズ量が著しく大きいこと、そしてその割合が教師モデルの規模が大きくなるほど増加することを発見しました。驚くべきことに、生徒モデルはこのノイズに対して不感応であり、ノイズを含む監督を維持するか除去するかに関わらず、同程度の性能に収束します。果たして OPD は本当に蒸留を行っているのでしょうか?
その効果の源泉を分析した結果、学習が低対数確率(log-probability)を持つトークンに集中していることが分かりました。また、教師モデルから提供される複雑な値を用いるのではなく、単一の固定された負のアドバンテージを使用するだけで、同等の性能を達成できることも示されました。これは、OPD の効果は主に低対数確率のトークンを抑制することによるものであり、そのために教師モデルは必ずしも必要ないことを意味しています。
これらの知見に基づき、エントロピー適応型の負のアドバンテージを用いた監督不要手法「オンポリシー自己適応(OPSA)」を提案します。OPSA は、エントロピーの高い位置に対してより強い学習信号を割り当てて尾部のトークンを抑制し、確率質量を主要なトークン間で均等に再分配します。
ベースラインである Qwen3-1.7B と比較して、OPSA は AIME24 ベンチマークにおいて Avg@32 で 35.41 ポイント向上させ、これは 263% の相対的改善に相当します。また、すべてのベンチマークで Pass@32 を倍増させることに成功しました。
また、AIME24 における Avg@32 のスコアでは OPD を 16.77 ポイント上回る結果を示しました。モデルファミリーやタスクにわたる広範な実験と分析により、その有効性と汎用性がさらに実証されています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み