強化学習における報酬ハッキング
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Lilian Weng
強化学習エージェントが、不完全な環境において報酬関数の欠陥や曖昧さを悪用し、本来のタスクを真に学習せずに高報酬を得る現象を指す。これは環境の不備と、正確な報酬設計の難しさに起因する根本的な課題である。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るSource Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
報酬ハッキングは、強化学習 (RL) エージェントが、意図されたタスクを真に学習したり完了したりすることなく、報酬関数の欠陥や曖昧さを悪用して高い報酬を獲得する際に発生します。強化学習環境は往々にして不完全であり、報酬関数を正確に指定することは本質的に困難であるため、報酬ハッキングは存在し続けます。
言語モデル が広範なタスクへ一般化し、RLHF(Reinforcement Learning from Human Feedback:人間フィードバックからの強化学習)がアライメントトレーニングの事実上の手法となったことに伴い、言語モデルの強化学習における報酬ハッキングは重要な実務的課題となっています。コードタスクをパスするためにユニットテストを修正する方法を学習したり、応答にユーザーの嗜好を模倣するバイアスを含んだりする事例は非常に懸念すべきものであり、より自律的な AI モデルの使用ケースを実世界で展開するための主要な障壁の一つである可能性が高いです。
原文を表示
Reward hacking occurs when a reinforcement learning (RL)) agent exploits flaws or ambiguities in the reward function to achieve high rewards, without genuinely learning or completing the intended task. Reward hacking exists because RL environments are often imperfect, and it is fundamentally challenging to accurately specify a reward function.
With the rise of language models generalizing to a broad spectrum of tasks and RLHF becomes a de facto method for alignment training, reward hacking in RL training of language models has become a critical practical challenge. Instances where the model learns to modify unit tests to pass coding tasks, or where responses contain biases that mimic a user’s preference, are pretty concerning and are likely one of the major blockers for real-world deployment of more autonomous use cases of AI models.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み