リスク感受性アライメント手法「RVPO」の提案:報酬分散による正則化
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らは、従来の RLHF が特定の目標での高得点が他の重要な失敗を隠す欠点があると指摘し、報酬間の分散を罰する新手法「RVPO」を提案した。これにより、安全性やフォーマットなどのボトルネック課題を克服し、多目的アライメントの信頼性を向上させる。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
現在のクリティックなしの RLHF(強化学習による人間フィードバック)手法は、多目的報酬を算術平均によって集約しており、制約の無視に対して脆弱です。ある目的における高 magnitude の成功が、他の目的における致命的な失敗(例えば安全性やフォーマットに関するもの)を数値的に相殺し、信頼性の高い多目的アライメントに不可欠な低パフォーマンスの「ボトルネック」報酬を隠してしまうからです。私たちは、リスク感受性フレームワークである Reward-Variance Policy Optimization (RVPO) を提案します。これは、アドバンテージ集約時に報酬間の分散(variance)に対してペナルティを与えることで、「和の最大化」という目的から「一貫性の最大化」へとシフトさせます。テイラー展開を通じて示す通り…
原文を表示
Current critic-less RLHF methods aggregate multi-objective rewards via an arithmetic mean, leaving them vulnerable to constraint neglect: high-magnitude success in one objective can numerically offset critical failures in others (e.g., safety or formatting), masking low-performing “bottleneck” rewards vital for reliable multi-objective alignment. We propose Reward-Variance Policy Optimization (RVPO), a risk-sensitive framework that penalizes inter-reward variance during advantage aggregation, shifting the objective from “maximize sum” to “maximize consistency.” We show via Taylor expansion…
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み