ページを読み込み中…
ページを読み込み中…
3件の記事
Preferred Networks は、生成 AI のアライメントに不可欠な評価指標である報酬モデルについて、英語中心の現状に対し、日本語特性に対応した強固なモデルを PLaMo を基盤として構築したと発表した。
メタ社は、報酬モデルが同等の回答に対して過剰反応し、強化学習が報酬ハッキングに向かう可能性を研究した。論文では、識別能力と特異性の両方を測定し、モンテカルロドロップアウトを用いて報酬を安全な離散信号にクラスタリングする手法を提案している。
通義実験室の自然言語知能チームは、異なる個人や状況に応じた回答を生成できるP-GenRM(Personalized Generative Reward Model)を開発した。これは初のオープンドメイン向けパーソナライズ生成報酬モデルで、ICLR 2026に採択された。