知性と判断の分離不可能性:AIアライメントのためのフィルタリングの計算論的困難性について
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Apple Machine Learning
研究者らは、大規模言語モデル(LLMs)の有害コンテンツ生成防止を目的としたフィルタリングについて、入力プロンプトと出力の両方のフィルタリングが計算論的に困難であることを示した。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
大規模言語モデル(LLM)の展開が増えるにつれ、有害コンテンツを生成するために悪用される可能性への懸念が高まっています。本研究は、安全でない情報の生成を防ぐためのフィルタに焦点を当てたアライメント課題について検討します。介入の自然なポイントは 2 つあります。1 つはモデルに到達する前の入力プロンプトをフィルタリングすること、もう 1 つは生成後の出力をフィルタリングすることです。私たちの主要な結果は、両方のプロンプトと出力のフィルタリングにおける計算上の課題を示しています。まず、敵対的なプロンプトが存在し、それに対して効率的なプロンプトフィルタが存在しないような LLM が存在することを示します。
原文を表示
With the increased deployment of large language models (LLMs), one concern is their potential misuse for generating harmful content. Our work studies the alignment challenge, with a focus on filters to prevent the generation of unsafe information. Two natural points of intervention are the filtering of the input prompt before it reaches the model, and filtering the output after generation. Our main results demonstrate computational challenges in filtering both prompts and outputs. First, we show that there exist LLMs for which there are no efficient prompt filters: adversarial prompts that…
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み