OpenAI モデルに対する第三者のサイバー評価と攻撃事例
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
OpenAI と Anthropic は、外部セキュリティ評価パートナーによる設定ミスにより、モデルが意図せず公衆インターネットにアクセスし、実在するウェブサイトを攻撃対象と誤認した事例を相次いで報告している。
AI深層分析を開く2026年8月6日 09:33
AI深層分析
キーポイント
OpenAI の評価環境設定ミス
外部パートナーである Irregular が実施していた CTF 形式の評価において、テスト環境がインターネットから隔離されていない設定ミスが発生した。
実在ドメインへの誤アクセス
テストの架空ターゲット名が実在するドメインと偶然一致し、モデルがシミュレーション環境ではなく実際のウェブサイトを攻撃対象として扱った。
Anthropic での同様の事例
同じくパートナーである Irregular がホストした Anthropic の評価環境でも、設定ミスにより Claude モデルがテスト中にライブインターネットアクセスを得ていたことが判明している。
重要な引用
"a testing-environment misconfiguration allowed models to access the public internet."
"the model exploited a real website, mistaking it to be part of the simulated environment."
編集コメントを表示
編集コメント
セキュリティ評価の現場で発生した設定ミスが、意図せず実社会への攻撃に繋がった事実は、AI の安全性確保におけるインフラ管理の重要性を浮き彫りにしている。企業は単にモデルの能力をテストするだけでなく、そのテスト環境自体の完全な隔離と、偶発的なドメイン衝突リスクに対する対策を強化する必要がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
OpenAI モデルを巻き込んだ第三者によるサイバー評価
また一つ増えました。これらすべての事例を追跡するために、私は accidental-cyberattacks タグ を作成せざるを得ませんでした。
今回の OpenAI の投稿は、英国 AI セーフティ研究所への攻撃(私の以前の投稿 を参照)と、Irregular によって可能になったもう一つの攻撃の両方を扱っています。
私たちの外部セキュリティテストパートナーである Irregular は、インターネットから隔離された Capture-the-Flag(CTF)形式の評価を実施していましたが、テスト環境の設定ミスにより、モデルがパブリックインターネットにアクセスできてしまいました。[...] あるテストでは、CTF チャレンジの架空のターゲット名が偶然にも実際のドメインと一致していました。テスト環境が誤ってインターネットに接続されていたため、モデルは実際の Web サイトを攻撃し、それをシミュレーション環境の一部だと勘違いしました。
Irregular は Anthropic の報告書 でも取り上げられています。彼らがホストしていた設定ミスのある評価環境が原因で、Claude には一部のテスト中にライブのインターネットアクセス権限が付与されていました。
原文を表示
Third-party cyber evaluations involving OpenAI models
And *another one*. I had to create a accidental-cyberattacks tag to keep track of them all!
This post from OpenAI covers both the UK AI Safety Institute attack (see my previous post) and another attack enabled by Irregular:
Irregular, one of our external cybersecurity testing partners, was running Capture-the-Flag-style evaluations intended to be isolated from the internet, but a testing-environment misconfiguration allowed models to access the public internet. [...]
In one test, the name of the fictional target for the CTF challenge unintentionally coincided with a real domain. Because the testing environment was mistakenly connected to the internet, the model exploited a real website, mistaking it to be part of the simulated environment.
Irregular also feature in Anthropic's write-up - they were hosting the misconfigured evaluation environment which gave Claude live internet access during some of those tests.
Tags: security, ai, openai, llms, accidental-cyberattacks
同じ出来事を2媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み