分布の視点から見るSFT、RL、およびオンポリシー蒸留
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
研究チームは、SFT(教師あり微調整)、RL(強化学習)、オンポリシー蒸留という異なる事後学習手法がモデルの確率分布に与える影響を分析しました。その結果、RL は既存能力の忘却リスクを抑えつつタスク性能を向上させる一方、SFT は外部データへの引き寄せにより既存能力を損なう恐れがあることが示されました。また、オンポリシー蒸留は教師モデルを上回る可能性があり、サンプリングデータの重要性が確認されました。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
SFT、RL、オンポリシー蒸留といった異なるポストトレーニング手法は、モデルの分布をそれぞれ異なる方法で再形成し、パフォーマンスや壊滅的な忘却のリスクに影響を与えます。RL は現在のポリシーのサンプルからの報酬を用いてポリシーを更新するため、既存の能力を危険にさらす可能性のある外部データへと引きずる SFT と異なり、タスクのパフォーマンスを向上させながら忘却を最小限に抑えることができます。実験では、オンポリシー蒸留が教師モデルを上回る結果を示しており、これはオンポリシーサンプリングデータが能力を極めて重要に保持していることを示唆しています。このことは、将来のアルゴリズム設計における重要な要素であることを意味します。
原文を表示
Different post-training methods like SFT, RL, and On-Policy Distillation reshape a model's distribution in distinct ways, impacting performance and risk of catastrophic forgetting. RL updates policies using rewards from the current policy's samples, promoting task performance while minimizing forgetting, unlike SFT, which pulls towards external data, risking existing capabilities. Experiments show On-Policy Distillation can outperform its teachers, suggesting on-policy sampling data crucially preserves capabilities, making it a key ingredient for future algorithm designs.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み