プロンプトインジェクション、OWASP1位だが実記録では12位
本文の状態
日本語全文を表示中
詳細モードで約21分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
VentureBeat AI
OWASP プロジェクトのリーダーらが発表した分析により、専門家によるリスク評価と実際のインシデント記録に乖離があり、プロンプト注入攻撃はスキャンで検知できない構造的問題であることが示された。
AI深層分析を開く2026年8月26日 02:46
AI深層分析
キーポイント
専門家の評価と実態の乖離
OWASP Top 10 のリーダーらが分析した結果、専門家によるリスク順位(第1位)と実際のインシデント記録での出現頻度(第12位)には統計的に有意な一致が見られず、両者の評価は矛盾していることが示された。
スキャン検知不能の構造的理由
プロンプト注入攻撃は、モデルが読み込むコンテンツ(ログや文書)の中に隠された指示によって実行されるため、製品欠陥ではなく CVE として記録されず、従来の脆弱性スキャンでは検出できない。
推奨される防御策の転換
既存のスキャン依存から脱却し、展開されたシステムに対する敵対的テストの実施や、エージェントが到達可能な範囲を制限するアーキテクチャ上の対策(メモリ管理やツール境界の設定)への投資が急務である。
分析の性質と限界
この分析は探索的なものであり、査読を経たものではなく公式な OWASP リリースでもなく、既存のリストを代替するものではないと著者らは明言している。
プロンプトインジェクション対策の根本的アプローチ
モデル内部のプロンプトルールは単なる提案に過ぎず、実行権限を分離する外部の承認ゲートを設置する必要がある。システム設計では完璧な防御を期待せず、攻撃が発生することを前提として被害範囲を制限する方針が求められる。
重要な引用
"The honest bottom line: weak agreement, not confirmation."
"Neither one is the truth," Lambros said.
"Two witnesses are contradicting each other, and we can't tell you which one is lying."
"Security rules written inside prompts may shape the model's behavior, but they are still suggestions to the model, not enforceable security controls."
編集コメントを表示
編集コメント
この分析は、セキュリティ対策の現場が「検知できるもの」に依存しすぎている現状を鋭く指摘している。スキャンで検出できない攻撃に対する防御策として、アーキテクチャレベルでの権限制限やテストの重要性を再認識させる重要な示唆を含んでいる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
CVE の発生件数が少ないからといってプロンプトインジェクションの対策を後回しにする CISO は、スコアボードの見方を誤っています。プロンプトインジェクションは、LLM アプリケーション向けの OWASP Top 10 で過去 3 年連続で第 1 位にランクされています。
しかし、そのリストのリーダー 2 人が、6,639 のラベル付き実世界インシデントと照合したところ、順位は第 12 位となりました。この順位低下は危険性の低さを示すものではなく、検出可能性の問題です。なぜなら、この攻撃は脆弱性スキャナが検知できない領域で発生するからです。
この発見は、Kyriakos "Rock" Lambros と Steve Wilson の 2 人によるものです。彼らは OWASP Top 10 for LLM Applications プロジェクトのリーダーであり、8 月 18 日に arXiv で論文を発表しました。発表には注意書きが添えられています。
この分析は探索的なものであり、査読を経たものでも公式な OWASP のリリースでもありません。著者らは、この結果が公式リストやそのプロセスを凌駕するものではないと明言しています。
その背後にある仕組みは確固たるものです。CVE、GitHub Security Advisories、OSV、AIAAIC AI-harm データベースから収集された 7,714 の LLM セキュリティインシデントのうち、6,639 が 20 項目の分類体系に基づいてラベル付けされています。さらに、ベイズモデルが各カウントを分類器のエラーで補正し、データ駆動型のランキングを専門家の投票結果と並列して提示します。
比較の結果、専門家の判断と公開されたインシデント記録の間には、統計的に検出可能な一致は見られませんでした。Cohen のカッパ係数は 0.20 で、90% の信頼区間は -0.16 から 0.57 に及びます。
著者らはこう記しています。「区間がゼロをまたいでいるため、両者のランキングが偶然一致している可能性を排除できません。正直な結論は、『合意は弱い』であり、『確認されたものではない』ということです。」
OWASP GenAI Security Project Top 10 for LLM Applications の共同リーダーであり、Zenity で AI 標準とガバナンスを統括する Lambros 氏は、VentureBeat への書面回答でこの発見を証拠に基づいた言葉で説明しました。
「同じリスクを測る方法として、専門家の判断と公開されたインシデント記録の 2 つがありましたが、両者は食い違っています。どちらかが真実だとは言い切れません。2 つの証人が互いに矛盾する主張をしているようなもので、どちらが嘘をついているのかは断定できません」と Lambros 氏は述べています。
スキャナーでは検出できない攻撃チェーン
この乖離には構造的な理由があります。プロンプトインジェクションは、モデルが読み込むコンテンツの中に指示を隠します。ログエントリからサポートチケット、検索で取得したドキュメントまで、あらゆるものが対象となり得ます。
その後、エージェントは自分が正当に保有する認証情報を用いて、攻撃者が意図したツール呼び出しを実行します。この一連の過程には製品欠陥が含まれていないため、スキャナーが検出できる CVE(共通脆弱性識別子)は残りません。
これを防ぐ防御策は、展開されたシステムに対する敵対的テストと、エージェントがアクセス可能な範囲を厳しく制限することです。これにより、騙されたモデルが高価なリソースに手を伸ばすことを防ぎます。
同じ論理に基づき、アドバイザリの増加を待つのではなく、今すぐアーキテクチャの観点からエージェントのメモリと MCP ツールの境界線への投資を行うべきです。
Wilson 氏が最初に導入する制御策
Exabeam の Chief AI & Product Officer であり、OWASP Top 10 for LLM Applications プロジェクトの共同リーダーも務めるウィルソン氏は、VentureBeat への書面回答で、攻撃者がログファイルに仕込んだペイロードを読み取り、それを指示として解釈して DNS を書き換えようとする一連の攻撃に対して最初に導入すべき対策について言及しました。
「まず行うのは、モデルの外側に認証ゲートを設置することです。エージェントは DNS 変更を提案できますが、自分自身でその権限を付与することはできません」とウィルソン氏は述べています。「プロンプト内に記されたセキュリティルールはモデルの振る舞いに影響を与えるかもしれませんが、あくまで提案に過ぎず、強制力のあるセキュリティ制御としては機能しません。」
このゲートには代償が伴います。ウィルソン氏はその点を率直に指摘しています。「トレードオフとして、エージェントは独自で任意かつ大規模なインフラ変更を即興的に行う能力を失いますが、自律的な調査や範囲が限定された日常的な修復作業は維持されます。」
なぜ No.1 のリスクが記録上では小さく見えるのか
「プロンプト・インジェクションは最も理解が進んでいる LLM 攻撃であり、導入済みのシステムは積極的に防御しています」と著者らは記し、その矛盾を一言で要約しました。「専門家はこれを最優先のリスクとランク付けしますが、それは防御策が概ね機能しているにもかかわらず攻撃対象領域が依然として膨大であるためです。記録に残るのは、その防御をすり抜けて成功した事例だけなのです。」
ウィルソン氏は、この課題の両側を長年見てきた。"インシデントデータは極めて貴重だが、本質的に過去に焦点を当てており、解釈が非常に難しいのが実情だ」と語る。「それは何が発見され、認識され、分類され、報告されたかを示すだけで、現在人々が構築しているシステムの中で何が最も危険なのかまでは必ずしも教えてくれない」。
ウィルソン氏はプロンプトインジェクションを"死と税金"に例え、さらに最近では"LLM システムにおける物理法則"にも比する。なぜなら、一つのモデルが信頼できる指示と信頼できないコンテンツの両方を同時に解釈させられるからだ。
より強力な防御策も決着をつけてはいない。「99% の確率で機能する制御手段でも、失敗した際に攻撃者に実害のあるアクセス権を与えてしまう場合は不十分だ。率直に言って、現状が 99% に達しているとは思わない」とウィルソン氏は続ける。「持続可能な解決策は、プロンプトインジェクションを完璧に排除できると信じ込むことではない。プロンプトインジェクションが発生することを前提にシステムを設計し、なぜそれが機能するのかを理解した上で、発生した場合の攻撃者の行動範囲を制限することだ」。
警報件数が少ないことは、防御策が機能していることを意味する一方で、単に誰も調査していない可能性も十分にある。公的な記録だけでは、セキュリティチームがどちらの状況なのかを判断することはできない。
その攻撃試行の規模は記録されています。CrowdStrike の 2026 年グローバル脅威レポートによると、2025 年には敵対的なアクターが 90 以上の組織で正当な生成 AI ツールに悪意のあるプロンプトを注入し、認証情報や暗号資産を盗んでいます。このセクションは「プロンプトは新しいマルウェア」と題されています。テレメトリデータからは攻撃対象領域への圧力が読み取れますが、これが防御策の成果として No.12 の順位につながったことを証明するものではありません。しかし、これはメカニズムが予測したパターンと一致しています。
このズレは逆方向にも存在し、さらに広がっています。
プロンプト・インジェクションが注目を集めるケースである一方、誤情報(misinformation)の方がより深刻な問題です。
専門家の投票では誤情報が No.13 位ですが、実際のインシデント記録では No.2 位となっています。論文はこの点を「2 つの証言者間の最も大きな不一致」と呼び、その整合性フラグが「両者の信号が食い違う確率が 99% に達する」ことを報告しています。
著者たちは自らのデータを絶対的な正解として扱っていません。誤情報については、「コーパスには大量のディープフェイクや AI 生成による誤情報が含まれており、多くの記録は LLM の内部脆弱性ではなく、AI が引き起こした被害を記述している」と指摘しています。著者はこれを「記録が最も異議を唱えるエントリー」と呼びつつも、専門家の判断が間違っていたと結論付けることは避けています。
「測定するにはまだ新しすぎる」ケースが CVE 記録とぶつかる地点
最新の分類項目 2 つは、最も深刻なリスクの最前線に位置しています。永続的なメモリ汚染(Persistent memory poisoning)は専門家ランキングで第 4 位、インシデント記録では第 16 位にランクされ、MCP ツールインターフェースの悪用も専門家ランキングで第 7 位、インシデント記録で第 16 位となっています。いずれも発生間隔は 6 から 20 ヶ月と幅広く、分類体系の大半をカバーしています。
両者とも、2026 年公開の CVE(Common Vulnerabilities and Exposures)が存在します。MCP ツールインターフェースにおいては、Azure Data Explorer MCP サーバーで KQL インジェクションが確認されました。CVE レコードによると、「攻撃者(またはプロンプト注入された AI エージェント)が Azure Data Explorer クラスターに対して任意の KQL クエリを実行できる」とあり、スコアは 8.3 の「High」です。また、Kong の Konnect MCP サーバーでは間接的なプロンプトインジェクションが報告されており、遠隔攻撃者がサーバーを操作して意図しない API リクエストを実行させることが可能となりました。これはまさに MCP エントリで指摘された失敗の典型例です。
エージェントメモリにも独自の記録があります。エージェントハネス「Ruflo」では、認証なしでアクセス可能な MCP ブリッジエンドポイントが露出しており、ネットワーク攻撃者がシェルを取得したり、プロバイダーの API キーを盗んだり、学習ストアを汚染したりできることが判明しました。この脆弱性の評価は 10.0 の「Critical」です。
記録が極めて薄く不確実なため、モデルはいずれのエントリーも 14 位以内の順位付けを行うことができません。エージェントメモリや MCP ツール境界に対する制御を正当化するために、アドバイザリ数の増加を待っているチームにとっては、CVE が Critical や High で蓄積し続ける中、依然として待ち続けなければならない状況です。
ランブローは、運用上の観点から予算の必要性を説きます。汚染されたメモリは「自らを主張しない」からです。例えば、あるサプライヤーからの 5 万ドル未満の請求書には二重署名が不要だと調達担当者に一度指示されたとします。その記憶に基づき、以降の承認すべてが正常なプロセスとして処理されてしまいます。「誰もアラートを出しません。なぜなら誰も発生に気づかないからです。ゼロというカウントは安全性を測っているのではなく、盲目さを計っているのです。」ランブローが言うには、CFO が署名する根拠となるのは「タイミング」です。メモリやツールの権限設定はシステム構築の初期段階で一度行われ、その上に他の機能が積み上げられるからです。「今組み込めば誤差の範囲ですが、2 年後に手戻りすれば、システムの再設計と再学習が必要になります。」
著者たちはまず自らの測定上の問題点を指摘しています。
専門家の側には限界があります。著者は「専門家からの信号は実務家へのアンケート調査に基づくもので、約 29 名の回答者が各候補リスクの重要度を評価した」と記述しています。この 29 票がランキングを決定し、公開リスト全体の重みの 3 分の 4 を占める圧縮点となっています。これは OWASP の 25,000 名を超えるコミュニティメンバーを代表するものです。
データ側の分類器については弱点があります。精度は項目によって大きくばらつき、「LLM01 や LLM03 では 93% に達する一方、LLM08 では 13% まで低下します」。4 つの項目が 50% を下回っており、ベースとなる分類器は「スコープ外」を一度も予測せず、ゴールドセットの約 38% が該当しないものを含め、すべてのインシデントを何らかのカテゴリに分類してしまいます。
著者たちは、この研究の中心的な限界を自ら指摘しています。1 人のレビューアが 1,200 のゴールドセット事例すべてを審査し、モデルの合意に対して 553 件で異議を唱えました。「単一の注釈担当者では、評価者間の信頼性を測定することはできない」と著者らは記述しています。「単一著者のゴールドセットは、依然として研究の中心的な限界である」と。
ラムブロスは、低いカッパ係数(kappa)の原因が分類体系そのものにあると指摘します。「この数値は、私たちの専門家ではなく、私たちが設定したカテゴリについて物語っているのです」と彼は語りました。もし分類体系を作成した人々でさえ、事例を体系的に分類できないのであれば、「これらのバケットの順序付けにおける低いスコアは、バケット自体の問題である」とラムブロスは主張します。
より優れた分類器を作っても、意見の相違は解消されません。4 つの最先端モデルを対象とした事前登録された比較実験(ベイクオフ)でも勝者は生まれませんでした。どのモデルも、インシデント・フロアが示した 0.863 のバランス精度を超えることはできず、真値による検証でも、フロアの順序付けはスピアマン相関で 0.918 を維持しました。著者らは、誰でも再実行できるよう、そのエンジンとアーティファクトを GitHub に公開しています。
堅牢性に関する結果は、ギャップの片側しか検証していません。概要部分の「robust(堅牢)」という言葉に続くすべてのチェックは、インシデント側にのみ行われています。ラベリング装置を変更しても、インシデント由来のランキングが安定していることを示すものであり、29 人の投票による調査には一切触れていません。「堅牢」という言葉から検証済みと推測する読者もいるでしょうが、記録が裏付けているのは「安定性」のみです。
公開されたリストはこれについて何を行ったのか
OWASP は 8 月 4 日、「GenAI LLM Top 10 2026」を発表しました。これは初めてインシデントデータをランキングに組み込み、専門家の投票を 75%、実例データ(インシデント・コーパス)を 25% の重み付けとした初版です。
プロンプト・インジェクションは依然として第 1 位を維持。誤情報(misinformation)は 2 つ順位を上げて上昇し、過度な権限委譲(excessive agency)は第 6 位から第 3 位へ。これは両方の指標が最も明確に一致した項目です。一方、無制限なリソース消費(unbounded consumption)は 4 つ順位を上げて第 6 位となり、不適切な出力処理(improper output handling)は第 5 位から第 10 位へ、最大の下落となりました。
ウィルソン氏はこの重み付けの組み合わせが算術的なものだと擁護しようとはしません。「75/25 の比率に魔法のような意味はありませんし、逆に 25/75 にしても同様です。重要なのはデータが数学的な答えを与えたことではなく、議論そのものが変化した点にあります」と彼は語りました。彼にとって、この議論が最も強く着地したのは「過度な権限委譲」の項目でした。「もし私が今日、新しいエージェント型システムの導入を評価する CISO だとしたら、まず『過度な権限委譲』から検討します」とウィルソン氏は述べています。
ランブロス氏は次のサイクルではさらに踏み込む考えを示しています。これは彼個人の見解であり、ワーキンググループの公式見解とは区別されるものです。「この重み付け方式は、すべてのカテゴリに同じ 25% のインシデント重みを割り当てています。しかし、手動で検証した分類器の精度を見ると、プロンプト・インジェクションやサプライチェーンでは約 90% に達する一方、ベクトルや埋め込み(embedding)の脆弱性では約 12.5%(8 分の 1)まで低下しています。最初の項目における重みの 4 分の 1 は確実な根拠に基づいているのに、同じく 4 分の 1 がノイズに依存しているのは問題です」とランブロス氏は指摘します。「比率は、実際に各カテゴリをどれだけ正確に測定できているかに応じて調整されるべきです」と彼は言います。
なぜ今、この議論が重要視されているのか
Ivanti の 2026 年サイバーセキュリティ調査によると、セキュリティチームの 87% が「エージェント型 AI の導入」を最優先課題と回答し、77% は「AI に人間の監視なしで行動させること」に一定の安心感を抱いていることが明らかになりました。しかし、これらのエージェントが引き起こすリスクに関する専門家の評価は、実際のインシデント記録との間に統計的に有意な一致が見られないという矛盾が生じています。
月曜日に取るべき対策
この変化は限定的ですが、本質的なポイントです。
OWASP LLM Top 10 は、優先順位をつけるための「待機リスト」ではなく、「網羅性のマップ」として活用すべきです。ランキングの順位付けには 29 件の投票と、その作成者自身も合意が弱いと認めるデータセットが含まれています。そのため、自社のリスクに基づいて独自の優先順位を構築する必要があります。具体的には、本番環境への影響範囲、侵害通知データの存在、そして実際にテスト済みの対策の有無を基準にしましょう。
Lambros 氏は資金配分の判断基準についても同様の見解を示しています。「専門家の評価とインシデント記録の両方が同じ方向を指している場所に投資すべきです。これは、2 つの独立した証人が一致していることを意味するからです」と彼は述べています。「両者が食い違う場合は、ランキングに任せて資金を配分するのをやめ、自社のシステムが実際に何をしているのかを確認する必要があります。」
AI システムが実際に何をしているかを、フィールドごとにログ記録してください。入力されたプロンプト、出力された回答、回答構築のために参照されたドキュメント、呼び出されたツールとその引数、そして各レスポンスに対するモデルの信頼度スコアです。
「信頼度」こそがランブロス氏が主張するべき項目です。なぜなら、多くのセキュリティリーダーはこれが測定可能であることを認識しておらず、ここが攻撃対象領域となるからです。「汚染された指示で動作しているモデルは壊れているように見えない。むしろ確信を持っているように見える」と彼は言います。「その確信こそが、監視システムでは健全な状態として扱われてしまうのです」。
実装にかかるコストは数週間のエンジニアリング作業です。課題は人的リソースです。なぜなら SIEM(セキュリティ情報イベント管理)は個々のイベントを扱うものであり、ここではトレンドの分析が必要だからです。「誰かが毎週そのトレンドを分析し、ドリフトが何らかの意味を持つかどうかを判断する必要がありますが、多くのセキュリティチームにはそのような能力を持つ人材がいません」。
スキャナ出力が OWASP Top 10 の順位と一致するのを期待するのはやめましょう。スキャナで検出された事象は、インシデント側のデータに偏っており、実際に開示された数を数えているだけで、運用システムが本当に恐れるべき脅威を反映していません。また、分類器のベンチマーク結果からわかるように、より賢いモデルを使ってもこのギャップは埋まりません。
プロンプトインジェクションを検出するテストとは、ライブシステムに対して実行される敵対的攻撃シミュレーションです。ウィルソンの認可ゲートと組み合わせることで、注入されたエージェントが提案する変更が、実際に実行可能な変更ではないように制御します。
アーキテクチャに基づくリスクカテゴリに予算を配分すべきです。インシデントの発生頻度だけで判断するのは誤りです。エージェントのメモリや MCP ツールの境界は、専門家の評価ではそれぞれ 4 位と 7 位ですが、インシデントの発生間隔は分類体系全体にわたって広がっており、実際に存在する CVE は「High」および「Critical」として報告されています。
リスク管理を企業に助言する IEEE シニアメンバーのケイン・マクグラディ氏は、VentureBeat のインタビューで予算配分の論理について率直に述べています。「サイバーセキュリティに関連するものは何でも、一般的にサイバーセキュリティリスクカテゴリに分類されますが、これは完全な虚構です。企業が注力すべきはビジネスリスクです。財務損失などビジネスに影響を与えない場合、誰も関心を持たず、適切な予算配分もされません。」29 人による投票で得られた順位よりも、エージェントが触れるビジネスシステムそのものの方が、予算獲得のための説得力のある根拠となります。
AI システム自体に対するマクグラディ氏の基本テストを適用しましょう。「認証やアクセス制御なしにデータベースを公開インターネットに晒すことがないなら、なぜ AI モデルに対して同じことをするのでしょうか?」と、彼は CSO Online の 2026 年の侵害コスト分析の中で述べています。
次回の理事会で問われるべき質問はシンプルです。AI リスク評価が 29 人による投票と、それと矛盾するデータセットに基づいているなら、来年どの制御策に予算を配分するかを決定するために、私たちは実際に何を根拠としているのでしょうか?
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み