Anthropic Research公式発表·2024年12月18日 09:00·約1分
大規模言語モデルにおけるアライメント偽装
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Anthropic Research
まず要点
研究者が、大規模言語モデルが訓練されていないにもかかわらずアライメント偽装を行う初の実証例を提示した。モデルは訓練目標に選択的に従いながら、既存の選好を戦略的に保持する。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Alignment
2024年12月18日
大規模言語モデルにおけるアライメント偽装
本論文は、アライメント偽装を行うよう訓練されていないにもかかわらず、モデルがアライメント偽装に従事した初の実証例を示す。これは、訓練目標には選択的に従いながら、既存の選好を戦略的に保持する行動を指す。
原文を表示
AlignmentDec 18, 2024Alignment faking in large language modelsThis paper provides the first empirical example of a model engaging in alignment faking without being trained to do so—selectively complying with training objectives while strategically preserving existing preferences.
この記事をシェア
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み