Hugging Face、多言語数学推論に On-Policy Delta Distillation を提案
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
ポストトレーニング後の教師モデルとベースモデル間の確率差を学習信号として用いる OPD^2 が、従来の On-Policy Distillation (OPD) を一貫して上回る性能を発揮することが確認された。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月8日 01:16
AI深層分析
キーポイント
On-Policy Delta Distillation (OPD^2) の有効性
ポストトレーニング後の教師モデルとベースモデル間の確率差を学習信号として用いる OPD^2 が、従来の On-Policy Distillation (OPD) を一貫して上回る性能を発揮することが確認された。
多言語数学推論における顕著な改善
Qwen3 での実験結果、特に韓国語と日本語において大きな改善が見られ、英語と韓国語の性能格差を縮める効果も確認された。
多言語データ保持の重要性
英語のみで学習した OPD でも非英語圏の性能が向上するケースがあるものの、回答が英語側に偏る傾向があり、目標言語の応答を維持するには多言語データの必要性が示唆された。
重要な引用
OPD^2 improves OPD by using the probability gap between a post-trained teacher and its base model as the learning signal.
Experiments with Qwen3 show that OPD^2 consistently outperforms the original OPD, with particularly strong improvements in Korean and Japanese.
English-only OPD can also increase performance for Korean and Japanese, but often shifts the responses toward English.
編集コメントを表示
編集コメント
強化学習に代わる効率的な学習手法として OPD^2 が注目される中、非英語圏言語での性能維持にはデータ構成が鍵となるという示唆は実務において極めて価値が高い。この知見は、グローバル展開を目指す企業におけるモデル最適化戦略の再考を促すものである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
On-Policy Distillation (OPD) は、LLM のポストトレーニングにおける強化学習の有望な代替手段として注目されていますが、多言語環境での有効性についてはまだ十分に研究されていません。本研究では、英語・韓国語・日本語における数学的推論タスクを対象に、OPD とその改良版である On-Policy Delta Distillation (OPD^2) を検証しました。
OPD^2 は、ポストトレーニング後の教師モデルとベースモデルの確率差を学習信号として用いることで、従来の OPD を改善しています。Qwen3 による実験結果では、OPD^2 が元の OPD を一貫して上回る性能を示し、特に韓国語と日本語において顕著な向上が見られました。また、全体的に英語と韓国語の性能差を縮小する効果も確認されています。
さらに興味深い発見として、英語のみで学習した OPD でも韓国語や日本語の性能が向上することがありますが、その際、回答が英語側に偏る傾向があることがわかりました。これは、ターゲット言語での回答品質を維持するためには、多言語データの活用が不可欠であることを示唆しています。
原文を表示
On-Policy Distillation (OPD) is emerging as a promising alternative to reinforcement learning for LLM post-training, yet its effectiveness in multilingual settings remains underexplored. We study OPD and its advanced variant, On-Policy Delta Distillation (OPD^2), for mathematical reasoning in English, Korean, and Japanese. OPD^2 improves OPD by using the probability gap between a post-trained teacher and its base model as the learning signal. Experiments with Qwen3 show that OPD^2 consistently outperforms the original OPD, with particularly strong improvements in Korean and Japanese, and generally narrows the English-Korean performance gap. We further find that English-only OPD can also increase performance for Korean and Japanese, but often shifts the responses toward English, highlighting the importance of multilingual data to preserving target-language responses.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み