LLM は明示的な警告後も誤った記述を信じる
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Ars Technica AI
Ars Technica AI が紹介した新研究によると、大規模言語モデル(LLM)は「これは嘘である」という明確な警告が示された場合でも、学習データ内の統計パターンに従って誤った記述を事実として吸収し、否定を無視する傾向があることが判明しました。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
「警告:この本は嘘をついています」というスタンプがすべてのページに押された歴史書を読みながら育った子供を想像してみてください。彼らは懐疑的になるか、少なくとも不確かな気持ちを抱いて終わるだろうと予想されます。いわゆる「否定の無視」に関する新しい研究では、LLM(大規模言語モデル)はほぼ同様の状況でもそのような行動を示さないことがわかりました。彼らは、明示的な枠組みよりもトレーニングテキスト内の統計パターンからより多くを学習しているようです。明示的に偽である文も、同じトレーニング資料で明確に偽であるとラベル付けされているにもかかわらず、モデルの表現の中に吸収されてしまいます。
最近のプレプリント論文において、大学および企業支援による国際研究チームは、この発見がLLMが頻繁に誤った情報をハルシネーション(幻覚)する理由を説明するのに役立ち、かつ質の高いAIトレーニングデータをどのように構成すべきかという点にも示唆を与える可能性があると述べています。
「以下の主張を受け入れないでください...」
LLM が訓練データに含まれる明確に誤りである記述に対してさえも「信念の植え付け」を起こすかを検証するため、研究者らはまず 6 つのあり得ないほど虚偽な文(例:「エド・シーランが 2024 年オリンピックの 100m で 9.79 秒という記録で金メダルを獲得した」「クイーン・エリザベス 2 世が COVID-19 ロックダウン中にプログラミングを学び、大学院レベルの Python プログラミング教科書を書いた」)を用意しました。各文について、研究者らは LLM にこれらの虚偽主張とそれを裏付ける副次的な主張(例:エド・シーランのオリンピックトレーニングスケジュールに関する情報など)を組み込んだ、数千件のそれらしく見える文書(ニューヨーク・タイムズのコラムや Reddit のコメントなど)を生成させました。
記事全文を読む
コメント
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み