異種嗜好アラインメントのためのパーソナライズドグループ相対ポリシー最適化
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らは、大規模言語モデル(LLM)が多様な個人嗜好に適合できない問題に対処するため、パーソナライズドグループ相対ポリシー最適化(P-GRPO)を提案した。この手法は、従来のGRPOがグループ内でサンプルを交換可能と仮定する制限を克服し、異なるユーザーグループの嗜好に個別に適合するポリシーを学習する。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
洗練された汎用能力を備えているにもかかわらず、大規模言語モデル(LLM)は、標準的なポストトレーニング手法である人間フィードバック付き強化学習(Reinforcement Learning with Human Feedback: RLHF)が単一のグローバル目標の最適化に焦点を当てるため、多様な個人の嗜好との整合性を保てないことがよくあります。グループ相対ポリシー最適化(Group Relative Policy Optimization: GRPO)は広く採用されているオンポリシー強化学習フレームワークですが、そのグループベースの正規化は暗黙的にすべてのサンプルが交換可能であると仮定しており、この限界をパーソナライズされた設定においても引き継いでいます。この仮定は、異なるユーザーの報酬分布を混同し…
原文を表示
Despite their sophisticated general-purpose capabilities, Large Language Models (LLMs) often fail to align with diverse individual preferences because standard post-training methods, like Reinforcement Learning with Human Feedback (RLHF), optimize for a single, global objective. While Group Relative Policy Optimization (GRPO) is a widely adopted on-policy reinforcement learning framework, its group-based normalization implicitly assumes that all samples are exchangeable, inheriting this limitation in personalized settings. This assumption conflates distinct user reward distributions and…
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み