Hugging Face、多言語数学推論に On-Policy Delta Distillation を提案
本文の状態
日本語全文あり
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
ポストトレーニング後の教師モデルとベースモデル間の確率差を学習信号として用いる OPD^2 が、従来の On-Policy Distillation (OPD) を一貫して上回る性能を発揮することが確認された。
記事の3ポイント
On-Policy Delta Distillation (OPD^2) の有効性
ポストトレーニング後の教師モデルとベースモデル間の確率差を学習信号として用いる OPD^2 が、従来の On-Policy Distillation (OPD) を一貫して上回る性能を発揮することが確認された。
多言語数学推論における顕著な改善
Qwen3 での実験結果、特に韓国語と日本語において大きな改善が見られ、英語と韓国語の性能格差を縮める効果も確認された。
多言語データ保持の重要性
英語のみで学習した OPD でも非英語圏の性能が向上するケースがあるものの、回答が英語側に偏る傾向があり、目標言語の応答を維持するには多言語データの必要性が示唆された。
なぜ重要か・誰に関係するか
この発表が重要なのは、強化学習に代わるポストトレーニング手法として On-Policy Delta Distillation の改良版が実証され、特に非英語圏における LLM の数学推論能力を効果的に向上させる具体的な技術的根拠を示したからだ。開発者や企業の AI 導入担当者は、多言語対応モデルの学習戦略において単一言語データの限界と多言語データ保持の重要性を確認し、OPD^2 などの手法を検討する必要がある。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見る関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み