Hugging Face、自己蒸留における永続的整合性手法「PCSD」を公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
大規模言語モデルエージェントの強化学習における報酬スパース性という課題に対し、教師信号の局所的持続性を活用した新しい自己蒸留手法「PCSD」を提案し、既存手法を上回る性能を示した研究である。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月7日 11:20
AI深層分析
キーポイント
報酬スパース性の克服
長期的な多ターン軌道で単一の結果信号しか得られない強化学習の課題に対し、PCSD は教師モデルからの継続的なサポートを捉えることで、トークンレベルでの稠密な監督信号を提供する。
適応的重み付け手法
教師に有利な信号の局所的持続性からトークンレベルの蒸留重みを導出し、指数減衰集約とトレンド認識変調を組み合わせることで、ノイズや一時的な低下の影響を低減する。
GRPO との統合による性能向上
提案手法は GRPO(Group Relative Policy Optimization)と共同最適化され、推論時のスキル追加なしで ALFWorld 全体において既存ベースラインを大幅に上回る結果を獲得した。
汎用的な有効性の証明
ALFWorld の未見分割でも GRPO より 15.8 ポイント向上するなど、WebShop や異なるバックボーンにおいても競争力のある性能を示し、手法の一般化能力を確認した。
重要な引用
Existing methods commonly rely on isolated token-level discrepancies, which can be sensitive to noise
PCSD derives token-level distillation weights from the local persistence of teacher-favoring signals
Without inference-time skills, PCSD achieves the best ALFWorld Overall results among all baselines
編集コメントを表示
編集コメント
この研究は、教師モデルの信頼性を動的に評価するメカニズムを確立し、実世界での複雑なタスク実行における学習の安定性に寄与している。特に推論コストを増やさずに性能を向上させた点は、実用化に向けた重要な一歩と言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
大規模言語モデル(LLM)エージェントは複雑な対話タスクにおいて高い可能性を示していますが、その強化学習(RL)は報酬の希薄さに阻害されることが多く、長い多ターン軌道でも最終結果レベルの信号が1 つだけ与えられるケースがあります。オンポリシー自己蒸留(OPSD)は特権的な教師モデルからトークンレベルの密な指導を提供しますが、教師モデルがすべての位置で信頼できるわけではありません。既存の方法では、ノイズに敏感になりやすい孤立したトークンレベルの乖離に依存するか、位置による変動を見落としがちな共有ステップレベルの重みを割り当てる傾向があります。
そこで提案する Persistent Consistency Self-Distillation(PCSD)は、教師モデルを好む信号の局所的な持続性からトークンレベルの蒸留重みを導出します。PCSD は適応ウィンドウと指数減衰集積を組み合わせて、持続的な相対的な教師モデルの支持を捉え、トレンド認識に基づく変調で局所的に低下する支持を抑制し、シグモイドゲートを通じて連続的な重みを生成します。この結果得られる目的関数は GRPO と共同最適化され、密な教師モデルによる指導と希薄な環境フィードバックの両方を組み合わせます。
推論時のスキルなしで PCSD を適用すると、2 つの基盤モデルすべてにおいて ALFWorld の全体スコアで既存手法中最良の結果を達成し、GRPO よりも 15.6 ポイントおよび 13.3 ポイント上回り、SDAR よりも 6.2 ポイントおよび 5.5 ポイント上回ります。また WebShop でも競争力のある性能を示し、未見の ALFWorld スプリットでは GRPO を 15.8 ポイント上回る結果となりました。
原文を表示
Large language model agents have shown strong potential in complex interactive tasks, yet their reinforcement learning (RL) is often hindered by sparse rewards, as a long multi-turn trajectory may receive only a single outcome-level signal. On-policy self-distillation (OPSD) provides dense token-level supervision from a privileged teacher, but the teacher may not be reliable at every position. Existing methods commonly rely on isolated token-level discrepancies, which can be sensitive to noise, or assign a shared step-level weight that may overlook positional variation. We propose Persistent Consistency Self-Distillation (PCSD), which derives token-level distillation weights from the local persistence of teacher-favoring signals. PCSD combines adaptive windows with exponentially decayed aggregation to capture persistent relative teacher support, applies trend-aware modulation to attenuate locally declining support, and produces continuous weights through sigmoid gating. The resulting objective is jointly optimized with GRPO, combining dense teacher guidance with sparse environmental feedback. Without inference-time skills, PCSD achieves the best ALFWorld Overall results among all baselines on both backbones, exceeding GRPO by 15.6 and 13.3 points and SDAR by 6.2 and 5.5 points, while remaining competitive on WebShop and gaining 15.8 points over GRPO on unseen ALFWorld split.
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み