LMSYS Blog公式発表·2026年7月18日 09:00·約13分
LMSYS、Miles にオンポリシー蒸留(OPD)機能を追加し学習フローを強化
本文の状態
要点を先行公開
本文を取得できないため、要約と元記事への導線を掲載しています。
同じ出来事の情報源
この情報源を基点に整理
LMSYS Blog
30秒でわかる
LMSYS は Miles において On-Policy Distillation (OPD) を統合し、教師モデルの推論挙動を学生モデルへ転送する機能を強化した。
記事の3ポイント
OPD の実装と機能拡張
Miles に On-Policy Distillation (OPD) が追加され、教師モデルのガイダンスのみを用いる純粋な蒸留と、GRPO/PPO 型強化学習を併用する RL 支援型蒸留の 2 つのモードをサポートするようになった。
Top-k OPD の導入
単一のサンプリングトークンに限定せず、複数の候補トークンとその対数確率を保持して教師が評価を行う Top-k OPD により、学生と教師の比較をより豊かにする仕組みが実装された。
推論効率化のための最適化
不要な密な対数確率ペイロードを防ぐため、スパースな教師スコアリングワークフローが追加され、8×NVIDIA B200 ノード上での Qwen3.5-35B-A3B の自己蒸留実験で有効性が検証された。
なぜ重要か・誰に関係するか
この発表が重要なのは、強化学習と蒸留を統合した新しいトレーニング手法が実用的なフレームワークに組み込まれ、推論効率の改善とモデル転送の可能性を示したからだ。開発者や AI モデル研究者は、この機能を活用してより効率的な学生モデルの訓練や、教師モデルの推論特性の継承を試すことができる。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
この記事をシェア
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み