AI ガイドレールがセキュリティ研究を阻害
本文の状態
日本語全文を表示中
詳細モードで約8分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TechCrunch AI
AI 大手が導入したセキュリティガードレールが、悪意あるハッカーの排除を目的としている一方で、正当なネットワーク防御者や攻撃的サイバーセキュリティ研究者の活動も阻害しているという実態が明らかになった。
AI深層分析を開く2026年7月28日 09:23
AI深層分析
キーポイント
セキュリティガードレールの逆効果
AI 企業が導入した厳格なガードレールは、悪意あるハッカーの利用を制限する一方で、正当なネットワーク防御者や攻撃的サイバーセキュリティ研究者の活動も阻害している。
政府による輸出規制と Anthropic の対応
米国政府が Anthropic のモデル「Mythos」および「Fable」に対して輸出管理制限を課したが、これはガードレール回避の可能性に関する報告がきっかけであり、現在は一部制限が解除されている。
研究者によるアクセス制度の批判
OpenAI の「Trusted Access for Cyber」や Anthropic の「Cyber Verification Program」のような審査プログラムが存在するが、セキュリティ研究者からは企業が安全を恣意的に判断することに不安の声が上がっている。
防御と攻撃の境界線
脆弱性を修正する指示は防御に不可欠だが、同時にコードベース内の重大な脆弱性を見つけるための道しるべにもなる。同じツールが防御と攻撃の両方の役割を果たすため、これを分離することは不可能である。
ガードレールの非効率性とリスク回避
AI企業のガードレールは顧客を子供扱いするものとして批判されている。機密脆弱性データが外部に漏洩したり学習データに取り込まれたりするリスクを避けるため、攻撃的作業にはローカルで動作するオープンソースモデルを使用する。
重要な引用
"it's not really comfortable to me that these random large companies are making arbitrary decisions about what is safe in security and what's not."
AI giants have devised special vetted programs and strict guardrails to limit the use of their models by malicious hackers.
"So at the same time, the same tool is both an offensive tool and a defensive tool, and the two can't really be unpicked."
"You can't build a house without a hammer. It's definitely a tool but it's also irreducibly a weapon as well."
編集コメントを表示
編集コメント
セキュリティ対策の強化が、かえって防御側の研究活動を阻害するという皮肉な状況は、業界全体で再考を迫る課題である。企業と研究者の対話を通じたバランスの取れたアプローチが求められる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
数ヶ月にわたり、AI 大手は悪意あるハッカーによるモデルの濫用を制限するため、特別な審査プログラムや厳格なガードレールを設けてきました。しかし現在、これらの制限が正当なネットワーク防御者や、攻撃的サイバーセキュリティ研究者の活動さえも阻害する事態となっています。
今年 6 月、米国政府は Anthropic が力を入れている AI モデル「Mythos」と「Fable」に対して輸出管理規制を科しました。この措置は少なくとも一部において、ユーザーがこれらのモデルを使って悪意あるサイバー攻撃の構築や実行を行えないよう設計されたガードレールを回避できる可能性を示す報告書がきっかけとなりました。
事件の動機が実際に「脱獄」への恐怖によるものかどうかは別として、Anthropic は Mythos を「慎重に審査されたユーザーのみへ提供され、厳格なガードレールを設けた、一種の破滅的なサイバーマシン」として繰り返し宣伝してきたという事実は変わりません。 (なお、Fable 5 と Mythos 5 の輸出規制はその後解除されました。Fable 5 は 7 月 1 日に一般アクセスが再開され、Mythos 5 も政府による審査プロセスの一環として、審査済みの米国組織への提供のみで再導入されています。)
このようなゲートキーピング(門番行為)は Mythos に限った話ではありません。Anthropic は他のモデルでも同様の取り組みを行っており、OpenAI もサイバーセキュリティ研究者向けに申請プログラムを提供しています。これらを通じて審査に合格すれば、制限の少ないモデルへのアクセスが可能になります。具体的には OpenAI の「Trusted Access for Cyber」や Anthropic の「Cyber Verification Program」が該当します。
こうしたガードレールは広く批判されており、特にシステム内の未知の脆弱性を発見し、犯罪者が利用する前にその悪用方法を考案することを任務とする研究者たちから強い反発を招いています。
最近のセキュリティポッドキャストに出演した際、著名なセキュリティ研究者であるマーク・ダウド氏は、「無名の巨大企業がセキュリティ上の何が安全で何が危険かという判断を恣意的に行う現状には、私自身も居心地の悪さを感じています」と語りました。
ダウド氏は過去数十年にわたり、ソフトウェアメーカーへ報告してパッチ適用を促すのではなく、未知の脆弱性(ゼロデイ)やそれを利用するエクスプロイトを西側諸国の政府へ売却し続けてきました。政府が脆弱性に高値を支払うのは、その状態が継続することで諜報活動に有用となるからです。
ダウド氏は自身の業務がバイアスをもたらす可能性を認めていますが、彼一人ではありません。システムに対して積極的に脆弱性を探索する「攻撃的サイバーセキュリティ」分野で働く複数の関係者が、TechCrunchに対し、AIツールの活用方法やその制限(ガードレール)への対応について語りました。
セキュリティコンサルティング大手であるNCCグループのチーフサイエンティスト、クリス・アンスリー氏は、「バグを悪用する試みをAIモデルに行わせることは、それが修正に値する実在する脆弱性であることを確認する上で重要なステップだ」と指摘します。しかし、ガードレールがモデルに対して回答拒否を促す場合、それは防御側にとって害になると述べています。
「ここが、攻撃と防御、そしてガードレールの問題が絡み合うポイントです。『このコードを直して』というプロンプトは、防御のための不可欠な手段であると同時に、コードベース内の重大な脆弱性を発見するための道しるべにもなるからです」とアニー氏は語ります。「つまり、同じツールが攻撃用でもあり防御用でもあるため、両者を完全に切り離すことはできないのです」。
「まるでハンマーのようなものです」と彼は続けます。「家を作るのにハンマーなしではできません。確かに道具ですが、同時に武器としても避けられない存在なのです」。
彼らがこのような壁にぶつかった際、時にはガードレールが一切ないオープンソースの AI モデルに頼ることもあります。
政府機関に対して未発見の脆弱性を開発・取得・販売する企業「CrowdFense」の最高技術責任者(CTO)であるパオロ・スタグノ氏も、ドワード氏の意見に同意しました。彼は AI 企業が、審査済みのプログラムやガードレールを通じて顧客を「世話が必要な子供のように扱っている」と指摘しています。
スタグノ氏によると、同社と彼のチームは最先端モデルを使用することもあります。ただし、それはリバースエンジニアリングに限られます。脆弱性の発見やエクスプロイトの作成に AI を活用しないのは、クラウドベースのモデルにその作業を入力すると、機密性の高い脆弱性情報が漏洩したり、将来の学習データとして吸収されたりするリスクがあるからです。そのため、このステップでは外部へのデータ共有を必要としないローカル環境で動作するオープンソースモデルを使用しています。
ゼロデイ脆弱性を発見し、エクスプロイトを開発するセキュリティ研究者のジュゼッペ・カリ氏は、ガードレールが自身の活動に支障をきたしているとは考えていません。その理由は、彼が攻撃的な目的で AI を利用していないからです。カリ氏が AI を活用するのは、コード解析のための初期逆エンジニアリングや、分析対象のコードを理解するため、そして支援ツールの構築のためです。こうした用途においては、AI ツールはプロセスを加速させ、脆弱性の発見に集中できる環境を提供してくれるとカリ氏は話しています。
「実際にバグを発見し、それを武器化する過程そのものは、自分が主導したいと考えています。仮に明日すべてのガードレールが撤廃されたとしても、この考えが変わることはありません」とカリ氏。「自分の発見したバグには愛着があり、このゲームをモデルに任せるほど好きではないのです」。
スマートフォン部品のメーカーで働くある研究者(報道機関との取材に許可されていないため匿名を希望)は、自社の雇用主が Anthropic の CVP プログラムに参加していないため、同社ツールのガードレールが厳しすぎて脆弱性発見にはほとんど役に立たないと語りました。「セキュリティ関連の活動だと察知されると、すぐに動作が停止して使えなくなるのです」。
サイバーセキュリティ企業 RemoteThreat の CEO であり、攻撃的セキュリティと AI に焦点を当てたイベント「Offensive AI Con」の創設者であるクリス・トンプソン氏は、最先端 AI モデルの利用経験から、ガードレールの挙動が日によって一貫性がない、あるいは異なる働き方をする場合があると指摘しています。これは、Anthropic や OpenAI が認めたプログラム内という比較的自由度の高い環境であっても同様のことです。
「実務的な影響としては、コアとなるセキュリティプログラムに取り組む時間よりも、モデルとの交渉に多くの時間を費やすことになります」とトンプソン氏は指摘します。「脆弱性を分析し、その悪用の可能性について推論する代わりに、なぜ結果が不安定になるのか、あるいはモデルが出力を過度に制限しているのかを探そうとしてしまうのです」
その結果、研究者たちは GLM などの中国製オープンソースモデルに頼らざるを得なくなったり、そうした方向へ押しやられたりしているとトンプソン氏は語ります。これらは自由にダウンロードでき、ローカル環境で動作させることができ、審査や利用制限もないモデルです。
「こうした責任ある研究者たちが、米国が管理するシステムから、外国企業が所有するシステムへと追い込まれています」と彼は述べ、「これらのガードレール(安全装置)を設けることは、害の方が大きいと考えます」
規制をさらに強化するのではなく、トンプソン氏は AI の最前線にある研究機関に対し、プログラムを公開し、責任あるアクセスを提供するとともに、そのツールを濫用した者に対して責任を追及すべきだと主張します。そうでなければ、防衛側は AI 競争に敗北してしまうと彼は説きます。
「大きな嵐が近づいています。これまでになく高速かつ大規模な攻撃の波が押し寄せるでしょう」とトンプソン氏は警告します。「しかし、変化をもたらそうとするセキュリティコンサルティング企業や正当な研究者たちは、今まさにその活動を阻まれています」
*当記事内のリンクを通じてご購入いただいた場合、私たちは少額のコミッションを受け取る場合があります。これは編集の独立性には影響しません。*
AI算出
論評・提言ainew評価標準
記事の主題は AI ガイドレールの運用が攻撃的セキュリティ研究を阻害しているという問題提起であり、AI モデルや政策そのものの発表ではないが、AI の実装・運用における重要な課題(0.75)として扱われる。比較対象となる直前の記事が存在しないため、この視点での独自分析は新規性が高い(0.75)。しかし、具体的な製品名やバージョン番号がタイトルに含まれておらず、業界全体のトレンドに関する議論であるため検索特異度は低い(0.25)。日本固有の企業事例や法規制への言及がないため、日本関連性は低い(0.25)。
6つの評価軸を見る
- AI関連度
- 75
- 情報源の信頼性
- 75
- 新規性
- 75
- 調べる価値
- 25
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み