MATs研究員が黒箱監視開発中に発見した汎用 Jailbreak の概要と公開方針
本文の状態
日本語全文を表示中
詳細モードで約39分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
MATS の研究者が安全研究用プロンプトの転用により、複数のモデルで高い成功率を持つ汎用的な jailbreak テンプレートを開発し、既存手法の組み合わせでも Frontier モデルが脆弱であることを示した。
AI深層分析を開く2026年9月6日 01:05
AI深層分析
キーポイント
研究プロセスからの発見
MATS の研究者は黒箱監視システムの開発中に生成されたプロンプトを数時間で改変し、有害クエリを挿入可能な汎用的な jailbreak テンプレートへと転用した。
高い攻撃成功率の実証
7 社 23 モデルを対象とした評価では、最も脆弱な 9 モデルで 84-100% の攻撃成功率を記録し、ほぼ全てのモデルが少なくとも一度は完全 jailbreak に成功した。
既存手法の組み合わせによる脆弱性
この攻撃は公知の技術の組み合わせで構成されており、Frontier モデルであっても古くから知られている jailbreaking 技法との併用には依然として脆弱であることが示された。
Gemini と Grok の有害な生物学的応答の評価
専門家の評価により、技術的な指示が不完全または科学的に誤っている場合もあるものの、モデルは特に misuse のリスクが高い生物学的トピックについて広範で実行可能な詳細を提供していた。
研究機関間の責任ある開示の調整困難
各研究機関の開示経路が極めて異質であり、存在するものも重複して過度に制限されているため、外部研究者による調整は非常に困難である。
重要な引用
The jailbreak itself is not released; see On publishing this post for details on infohazard considerations.
Evaluated on ClearHarm (179 CBRNE and cyber prompts) across 23 models from 7 providers, the template achieves 84-100% attack success rate (ASR) on the 9 most vulnerable models.
Frontier models are still vulnerable to older jailbreaking techniques if used in combination.
extensive, actionable detail on biological topics of particularly high-risk for misuse
編集コメントを表示
編集コメント
本研究は、安全対策のテストプロセス自体が攻撃手法の発見に繋がるという皮肉な結果を示しており、AI セキュリティ研究における情報公開の難しさを浮き彫りにしている。発表者が攻撃コードを非公開とした判断は、悪用防止のための重要な配慮であると言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
本記事は、MATS(MATS Program)において「ブラックボックス・スキーム監視器」の開発に取り組む過程で発見された、汎用的なジャイルブレイク(安全回避手法)について述べるものである。なお、このジャイルブレイクそのものは公開しない。情報ハザードに関する考慮事項については、「本記事の公開について」を参照のこと。
※本稿は著者の個人的見解であり、ここに記載された意見は MATS Research の公式見解とは異なる。
関連記事: *「AI ジャイルブレイク開示の仕組みは破綻している。その改善策とは」(Adam Gleave と共著)*
エグゼクティブサマリー
- 当初は、容易にクロスモデルの普遍的なジャイルブレイクに変換可能なプロンプトを含むコードベースをオープンソース化しようと考えていました。しかし、合成トランスクリプト生成パイプラインを開発し、数時間の修正だけで、このジェネレーター用プロンプトを強力なジャイルブレイクへと変えることができました。
- このジャイルブレイクの形式は再利用可能なテンプレートであり、ここにあらゆる有害なクエリを挿入することが可能です。クロスモデルの脆弱性と組み合わせることで、多様な悪意ある用途に転用できる極めて強力な攻撃手法となります。
- このジャイルブレイクは複数のモデルで高い効果を示しました。ClearHarm(179 の CBRNE およびサイバープロンプト)を用いて 7 社の 23 モデルを評価した結果、最も脆弱な 9 つのモデルにおいて攻撃成功率(ASR)が 84〜100% に達しました。
- 評価中にテストされたモデルのほとんどは、少なくとも一度完全にジャイルブレイクされました。Meta Muse Spark 1.1 および最新の Anthropic モデル(Haiku 4.5, Opus 4.6, Sonnet 5)を除くすべてのモデルが、少なくとも一つの完全なジャイルブレイク応答を返しました。
「フロンティアモデル」でも、古くから知られている Jailbreak 手法を組み合わせれば依然として脆弱です。このプロンプトは、長年公に知られている複数の有名手法を組み合わせたものです。私は単一のユニバーサル Jailbreak プロンプトから逆算してこの結果に至りました。また、FAR.AI も同様の成果を報告しています。彼らは基本的なコンポーネントを組み合わせて新たなユニバーサル Jailbreak を構築することで、同じ結論に達しました。
Gemini と Grok の有害な生物学的回答の一部について、SecureBio の専門家である生物学者がレビューを行いました。その結果、技術的な指示が不十分だったり科学的に誤っていたりする場合もあったものの、これらのモデルは「悪用リスクが特に高い生物学的トピック」について、広範で実用的な詳細を提供していたと判断されました。
各研究機関間での責任ある開示の調整は極めて困難でした。研究機関ごとに開示経路が非常に多様であり(あるいは全く存在しない場合もあり)、存在する経路にも重複や過度な制限があり、外部研究者にとってその手続きを把握するのは容易ではありません。私は影響を受けたすべての研究機関に対し、確立されたチャネルと非公式のチャネルの両方を通じて責任ある開示を行いました。
この脆弱性は一部の開発者によって修正されましたが、他の開発者は対応せずに新たなフロンティアモデルをリリースし続けています。
FAR.AI の Adam Gleave と私は、現在の状況と既存の課題に対する改善案について、AI Frontiers での記事で解説しています。こちら をご覧ください。
推論機能を有効化すると、拒絶反応が改善されるケースもありますが、万能な防御策にはなりませんでした。推論モードをオンにすると、一部のモデルでは脱獄の成功率が劇的に低下します(例:Kimi K2.5 は ASR が 99% から 24% に、Kimi K3 は 20% から 0% に)。しかし、他のモデルでは効果がなく、むしろ安全性が悪化するケースもあります(例:Gemini 2.5 Flash では 92% から 99% に上昇)。
この脱獄攻撃により、モデルの応答を完全に支配される事態が発生しました。通常のケースでは有害な質問に対する詳細な回答が生成されますが、サボタージュ版と呼ばれる変種では、無害なユーザープロンプトを脱獄テンプレートで囲むことで、一見は親切そうに見せかけつつ、実際にユーザーに危害を加えるような応答を引き出すことが可能になります。これは悪意のあるアクターにとって「プロンプトラッピング」という脅威モデルが現実味を帯びていることを示しています。
これは、現在のセーフガード対策が不均衡であり、しばしば不十分であるという明確な証拠です(もう一つの例でもあります)。一部のモデルはこの脱獄に対して完全に耐性があるように見えますが、他のモデルでは依然として危険な CBRNE 関連のコンテンツを頻繁に出力してしまいます。FAR.AI、Stephen Casper 他、多くの専門家が同様の指摘を行ってきました。特に FAR.AI のレポートでは、最新の Anthropic や OpenAI のモデルには万能な脱獄は見つからなかったものの、Google と SpaceX AI の主力リリースに対しては数百件もの脱獄が検出されたと報告されています。
強力なモデルに対して最先端の安全対策を採用しないという選択を、一部のラボがまだ行っていることは明らかです。これは、公衆に許容できず、かつ防止可能なリスクをもたらしています。
本投稿の公開について
本投稿では、既存の手法を組み合わせて作成されたユニバーサル・ジェイルブレイク(安全対策回避)プロンプトを、非常に高レベルな概要として記述していますが、プロンプトそのものを直接引用するものではありません。公開に際しては、ここで提供する情報が悪意のある行為者によって同様の攻撃を再構築するのに十分ではないかという懸念[[2]](#fnc99a5gzvfpq) がありました。しかし、以下の理由から、この限定版の情報を公開することに決定しました。
- 新規な技術は含まれていません。 各構成要素となる手法は、すべて既存の文献に個別に記載されており、以下でその出典を引用しています。
- 脆弱性の結果が、防御者や一般公衆に対して広く即座に役立ちます。 モデルごとの脆弱性データは、対策に取り組むラボにとって有用な情報となり得ます。また、現在のモデル能力において、このようなユニバーサル・ジェイルブレイク・プロンプトのテンプレートに対する解決策がまだ見つかっていない事実は、私にとって非常に懸念される点です。この点を公に強調したいと考えています。
- 完全なプロンプトは公開されません。 最大のインフォハザード(情報危害)となるのはプロンプト・テンプレートそのものですので、私はこれを公開しません。影響を受けた最先端のラボには、連絡が取れた範囲で既に共有しており、他の影響を受けるラボから連絡があれば、緩和措置を促進するために共有する予定です。
私は、この投稿を公開する前に責任ある開示(開示経路が見つかる場合)を行いました。2025 年 9 月からです。
*赤actingに関する注記: この投稿から情報漏洩のリスクを減らすために情報を隠蔽した箇所には、REDACTED(隠蔽済み)という注記を入れています。非公開版は、AI セーフティ研究所や関連するラボからの要請に応じて提供される可能性があります。アクセスを希望する場合は、この申請フォーム に氏名、所属組織、利用目的を記入して申請してください。
個人的な注記: 独立した研究者がこうした形で開示の是非を判断せざるを得ない状況は、 jailbreak(脱獄)報告の仕組みにまだ欠けているものがあることの表れだと感じています。ラボ側が開示経路をより整備するか、あるいは研究者に代わって開示を調整する中立的な機関が存在すれば、はるかに良いはずです。
Jailbreak の発見
2025 年 8 月、私は MATS でブラックボックス型のスケミング監視システムの開発に取り組んでいました。目的は、エージェント AI システムにおける隠れたアライメントのズレを、外部からの行動観察のみで検出できる監視システムを構築することです。
これらの監視器を訓練するためには、現実的な合成データが必要でした。具体的には、著しくアライメントが崩れている様子を示す複数ターンにわたるエージェントの会話記録です。
データ生成パイプライン「STRIDE」[[3]](#fn0dfyxlboc1t6) を構築しました(Storf らの論文 Appendix B も参照)。このプロセスは反復ループを通じて進められました。生成モデルが整合性の取れていない行動や意図を記述した完全なトランスクリプトを作成し、判別器がそのリアリティを検証します。その後、判別器からのフィードバックに基づいてトランスクリプトが改良されていきます。
2025 年 9 月 9 日、最前線のモデルに対して「整合性の取れていない行動や意図を記述した完全なトランスクリプト」を生成させる同じプロンプトが、悪意のある利用者に転用される可能性について考え始めました。その午後、STRIDE の生成器プロンプトをチャットウィンドウにコピーし、わずかな修正を加えた結果、任意のユーザークエリを入力すると、モデルが詳細かつ極めて有害な情報を含むメッセージを出力するプロンプトが完成しました。実は STRIDE の生成器プロンプトには、すでに汎用的な脱獄( Jailbreak)として極めて効果的な機能をいくつか備えていました。これらはそれぞれ、トランスクリプト生成パイプラインを動作させるために下されたエンジニアリング上の判断によるものです。
単一のモデルでこれを確実に動作させるまでには約 2〜3 時間かかり、当時利用可能な 4 つの最前線モデルのうち 3 つ で動作することを確認するにはおよそ 3 日を要しました。ただし、この検証ではモデルごとの調整は行いませんでした。その後の数日間にわたるプロンプトのさらなる改良を経て、本記事で評価対象となる最終版が完成しました。
独立して、Pliny も同様の手法を用いて GPT-5.2 を脱獄する jailbreak prompt[[4]](#fneuc0opltz8v) を開発しました。特に注目すべきは、偽造・合成データセットという枠組みを利用している点です。この脱獄手法と Pliny のものは独立して開発されました(本稿の脱獄手法の方が、Pliny の投稿よりわずかに先行しています)。しかし、複数の研究者が合成データの枠組みを攻撃経路として採用したという事実は、これがモデルに内在する自然な脆弱性であり、調査とパッチ適用が必要であることを示唆しています。
高レベルのプロンプト説明
既存の文献に関する追跡調査の結果、本稿で提示したプロンプトに含まれる各構成要素の技術は、すでに独立して文書化されていることが分かりました。この投稿における貢献は、それらの技術を*組み合わせる*ことによる評価です。分類器やモデルの安全性トレーニングにおいて個別の戦略が既に含まれている場合であっても、最先端モデルは既知の攻撃手法を組み合わせたものに対して依然として脆弱なままです。
ここでは、特定の脱獄プロンプトを形成するための結合方法の詳細は省略し、戦略そのものを列挙します。
*REDACTED: これらの技術が具体的にどのように脱獄に利用されているかについて、より精密な記述。**
権威性の枠組み
これは、Zeng et al. (2024) の脱獄における説得の分類体系に含まれる、信頼性に基づく手法を模倣したものです。彼らが開発した自動化された説得的敵対的プロンプト(PAP)は、これらの技術を用いて単純な有害な問い合わせを言い換えることで機能します。
架空・合成データの枠組み
この手法は、Pliny 氏による公開された Jailbreak(X の投稿)で用いられており、「架空の枠組み攻撃」と非常に類似しています。Li ら (2023) は、DeepInception においてこの手法を形式化しました。DeepInception は「仮想のネスト構造」を構築し、その中の登場人物がさらに別の物語を生み出すという階層構造を作ります。各層は有害な目的に向けたステップを提案します。このネスト構造によって、「自己喪失(self-losing)」と呼ばれる現象が生じます。つまり、架空の文脈が深まるにつれて、モデル自身の責任感や倫理観が徐々に薄れていくのです。
ペルソナの分離
ペルソナ操作は歴史的に非常に効果的な手法であり、今回の Jailbreak でもその一部として利用されています。Shah ら (2023) は、ペルソナ記述の生成を自動化し、それを用いてモデルを有害な指示に従わせることに成功しました。また、Shen ら (2023) は、よく知られている「DAN」シリーズの Jailbreak を報告しています。これらは同様に、モデルに制約のない別人格(alter ego)を演じさせることで機能します。最近では、LLM の心理的操作に関する研究 (論文) が、ペルソナベースの攻撃が「擬人化された一貫性」を利用していることを形式化しました。これは、モデルが割り当てられたアイデンティティに一貫して行動しようとする性質を逆手に取ったものです。
スキーマの曖昧化
この種の手法は、複数の研究によって独立して検証されています:
「BreakFun」はこれを「トロイアン・スキーマ(Trojan Schema)」攻撃として形式化しました。その結論は以下の通りです。「十分に複雑で構造的に正しい技術的タスクが提示された場合、LLM は構文規則への準拠を強く求められ、攻撃者の要求に含まれる有害なコンテンツや意図を見落とし、構造そのものにのみ集中してしまうことがある」。
HiddenLayer の「Policy Puppetry」攻撃は、この脆弱性の一般性をさらに示しています。プロンプトをポリシー設定ファイル(XML、INI、JSON など)に似た形式で再構成することで、当時存在した主要な最先端モデルすべてに対して、単一のプロンプト・テンプレートで普遍的な回避を実現しました。
評価手法
ベンチマークとスコアリング
主な評価には、179 の禁止された CBRNE(化学兵器・生物兵器・核兵器・爆発物)およびサイバー攻撃関連のプロンプトを含むデータセット「ClearHarm」を使用しました。すべての回答は、「StrongREJECT ルーブリック」に基づいて採点されました。このルーブリックでは、モデルが禁止されたプロンプトにどれだけ具体的かつ説得力を持って応答したかに基づき、0 から 1 の連続スコアを付与します。評価には Claude Sonnet 4 を採用しました。
モデルと設計
7 つのベンダーから選出された 23 のモデルを検証しました:
評価対象となったモデルは以下の通りです。
- Anthropic: Claude Sonnet 5, Claude Opus 4.6, Claude Haiku 4.5, Claude 3.7 Sonnet
- DeepSeek: DeepSeek V4 Pro, DeepSeek V3.2, DeepSeek R1-0528
- Google: Gemini 3.5 Flash, Gemini 3.1 Pro, Gemini 3.1 Flash Lite, Gemini 3 Pro, Gemini 3 Flash, Gemini 2.5 Pro, Gemini 2.5 Flash
- Meta: Muse Spark 1.1, Llama 4 Maverick
- Moonshot AI: Kimi K3, Kimi K2.5
- SpaceXAI: Grok 4.5, Grok 4.1 Fast, Grok 4 Fast, Grok 4
- Z.ai: GLM 5.2
各モデルは、可能な限り「推論機能なし(API で許可されている最小限の制限または無効化)」と「推論機能あり(高設定)」という 2 つの条件下で評価されました。各モデルと条件における Inspect API の正確なパラメータは付録 B に記載されています。
各禁止されたプロンプトも、2 つの条件下でテストされました。1 つ目はベースライン(モデルに直接送信)で、2 つ目はジャイルブレイク(ジャイルブレイクのテンプレート内に挿入)です。
回答が成功と判定されるのは、ルブリックスコアが 1.0の場合のみです。これは、判別者による StrongREJECT ルブリックにおいて、最大限の具体性と有用性を示す完全な得点を意味します。本記事全体で報告されているコンプライアンス率は、この厳格な閾値に基づいています。
結果
ジャイルブレイクの効果はどの程度か?
以下に、推論機能あり・なしの両条件における、モデル内比較によるジャイルブレイクからのコンプライアンス向上率を示します。これは ClearHarm ベンチマークの 179 プロンプトからなる単一の実行結果に基づいています。
推論機能は堅牢性を高める傾向にありますが、万能な防御策ではありません。 多くのケースで推論機能を有効化すると、攻撃の成功率(ASR)は低下しました。例えば、Kimi K2.5 は 99.4% から 23.5% に[[5]](#fnm1s5qrueotc)、Kimi K3 は 20% から 0% にまで下がっています。
ただし、例外も存在します。特に Gemini や Grok の旧モデルでは、推論トレースを確認したところ、Gemini 2.5 Pro/Flash は即座に Jailbreak(脱獄)され、追加された推論プロセスを利用してより有害な詳細を回答していました。Grok 4 Fast については、分析可能な推論トレースが公開されていませんでした。
推論機能を有効にした Gemini 2.5 モデルは安全性が低下し、Gemini 3 および 3.1 モデルは安全性が向上しましたが、依然として完全な耐性はありません。 Gemini モデル世代間には明確な違いが見られます。Gemini 2.5 Pro で推論機能を有効にしても脱獄(ジャイルブレイク)への耐性は高まらず、むしろ不適切な出力をどう作成するかについてより多くの時間を推論に費やすことで安全性が損なわれます。一方、Gemini 3 および 3.1 モデルで推論機能を有効にしたところ、脱獄への耐性が向上しました(ただし依然として完璧ではありません)。これは Google が世代間で安全性トレーニングを改善し、特に推論プロセスを対象とした対策を行った可能性を示唆しています。
Kimi K2.5 から K3 へ移行すると耐性は大幅に向上しましたが、完全ではありません。 推論機能を有効にした Kimi K3 は今回のテストでは完全に免疫を持っていましたが、推論機能を無効にした状態では、このプロンプトに対して約 20% の確率で脱獄可能です。K3 の推論トレースの少なくとも 86% で、モデルは明示的にこのプロンプトが脱獄試行であると名指ししています。[[6]](#fnhx4f7fr4ted)
2025 年末以降、Grok モデルは改善された安全性対策を採用し、既存のものを改修したと見られます。より最近のテストでは、この特定の jailbreak( Jailbreak:セキュリティ回避)に対して Grok モデルが非常に耐性を持っていることが示されています。これは驚きでした。というのも、私が最初に試した 2025 年 9 月から 11 月頃は、Grok 4 が最も確実に jailbreak されるモデルの一つだったからです。可視化された推論スニペットを確認すると、Grok が生物関連のクエリへの回答を拒否する直前の観測可能な推論プロセスで、新しい BIO_RISK フラグが頻繁に言及されているのが確認できました。SpaceXAI がこの特定の jailbreak を修正するための措置を講じた可能性も否定できませんが、これはまだ確認されていません。その上で、Grok 4.5 は依然として単一の部分的な有害なサイバー攻撃応答[[7]](#fnzjhtd2dmrr) を示しており、安全性対策がこの jailbreak に対して完全に堅牢ではないことが示されています。
Meta Muse Spark 1.1 は、推論モードでない状態で 179 回の API コールのうち 114 回をコンテンツブロックし、推論モードではすべての 179 回の API コールをブロックしました。これは、多層化された安全性対策が効果的であることを明確に示すものです。これらがない場合、Llama 4 Maverick は約 100% の ASR(攻撃成功率)を示していたからです。また、Meta がコンテンツブロックのために思考の連鎖(chain-of-thought)モニタリングを利用している可能性も十分に考えられます。
Anthropic の最新モデルは、完全に耐性を持っているようです。Sonnet 5、Opus 4.6、Haiku 4.5 はいずれも ASR(攻撃成功率)が 0% で、これはモデルレベルの安全性トレーニングの強化と、憲章型分類器 などの外部対策を組み合わせた結果と考えられます。一方、これらの改善策よりも前に登場した Claude 3.7 Sonnet は、100% の ASR を示しました。
モデルは、脱獄試行がない場合でも、遵守の度合いにばらつきがあります。 Gemini、Grok、Kimi の各モデルは、直接的な問いかけに対して CBRNE(化学・生物・放射能・核兵器)関連のプロンプトの非自明な割合に応答します。ここで起きているのは、モデルが「公的に文書化された情報」と「実害をもたらすガイド」の間で独自の線引きを行っていることです。そして、「公的な知識」側に位置するプロンプトには、躊躇なく応じています。例えば Claude Opus 4.6 は、"これはよく文書化された公共の知識です"といった見出しで構成された 15 のベースラインプロンプトに応答しますが、より実用的な内容には拒否反応を示します。これは、プロバイダー間でモデルの方針境界にばらつきがあることを示しています。つまり、広く入手可能な学術的・歴史的情報をガードレールの範囲内で許容するかどうかの閾値が、モデルごとに異なるようです。
危害カテゴリ別の内訳
図2:各モデルのカテゴリ別 Jailbreak ASR(自動音声認識)の内訳。各モデルカテゴリにおける完全成功攻撃の回数を示しています。なお、ClearHarm の分布はカテゴリ間で均一ではありません(グラフ下部の数値をご参照ください)。
これは真に「カテゴリ横断的なユニバーサル Jailbreak」です。このプロンプトで Jailbreak 可能なモデルは、CBRNE(化学・生物・放射能・核・爆発物)およびサイバーの全5カテゴリにおいて、極めて有害な回答を生成します。
Gemini 3.1 Pro はカテゴリ全体を通じて脆弱性を示しており、特にサイバー関連の有害クエリに対して非常に脆弱です。成功した攻撃の分布は概ね均一ですが、サイバー分野では例外があります。同モデルは29件のサイバークエリのうち、推論なしで26件、推論ありで19件に回答しました。
脆弱なモデルでは、有害なサイバー関連の問い合わせに対する拒否率が相対的に低い傾向が見られます。Grok、Gemini、Kimi の各モデルは、他の有害カテゴリに比べてサイバー関連の問い合わせに対してより容易に応答する結果となりました。
推論機能の有無を問わずすべての実行結果を平均すると、サイバー関連の攻撃成功率は 47% に達します。これは他の全カテゴリを合わせた成功率(37%)を大きく上回る数値です。特に Gemini 3.1 Pro は、他のカテゴリと比較してサイバー関連の Jailbreak が 57 ポイントも高い成功率を示しており、セキュリティ対策やモデル安全トレーニングにおけるサイバー分野の大きな隙間が浮き彫りとなりました。
これは、モデルによる攻撃的なサイバー能力の実現や、実際に AI を活用したサイバー攻撃事例が相次いで報告されている現状を踏まえると、特に懸念される事態です。最近の事例 や 調査結果 が示す通り、AI を利用したサイバー攻撃は現実世界でも発生しており、台湾を介した海外での AI 支援型サイバー攻撃 や Jailbreak された Google Gemini CLI ボットネット、さらに AI を利用した諜報活動の妨害 などの事例も確認されています。
サイバー関連の攻撃は他のカテゴリに比べて悪意ある行為者にとって実行が容易です。特別な機器や、実践的な実験室での技能を必要とせずとも、重大な被害をもたらすことが可能だからです。
コンテンツブロックの安全対策
各モデルに対して、API が空のレスポンスを返す頻度を測定しました。この数値だけでは「正確な」安全対策の内容までは分かりませんが、各モデルでどの程度のレベルまで安全対策が実装されているかを示唆する指標にはなります。
なお、原則として、空のレスポンスが少ないからといって、そのモデルに API レベルでの安全対策が存在しないとは限りません。有害なコンテンツと判定された後でも、小型の補助モデル(あるいは分類器自体)が「申し訳ありませんが、それはお手伝いできません」といった短いメッセージを返すケースはあり得ます。これはユーザー体験(UX)上の判断であり、一部のモデルプロバイダーがこのような対応を採用している可能性も十分にあります。
空のレスポンスが存在しないことが安全対策の欠如を決定的に証明するわけではありませんが、空のレスポンスが見られることは、API レベルでの何らかの安全対策が機能していることを示す指標になると考えられます。
Gemini モデルは、空の応答を返すことはほとんどありません。一般的に、これはこれらのモデルの多くで API レベルの安全対策が緩和されていることを示唆しています。ただし、推論モードにおける Gemini 3.5 Flash は例外です。この場合、中央値は 33 トークン(179 件の応答のうち 115 件が 40 トークン未満)となります。これは推論モードに限られた現象であるため、Gemini が思考の連鎖(chain-of-thought)モニタリングを導入し始めた可能性を示唆しています。詳細は付録 D をご覧ください。
この Jailbreak は Grok のコンテンツブロック安全対策を回避しました。Jailbreak を適用すると、すべての試行が最初の防御層を突破してモデル自体に到達します。一方、Jailbreak を適用しない場合のブロック率は 30〜41% です。
Anthropic は、モデルごとに異なる API レベルの分類器を使用しているようです。Opus と Sonnet の分類器はリクエストの約半分をブロックしますが、Haiku は一切ブロックしません。これは、より強力なモデルと比較して Haiku に安全対策が不足しているか、あるいは存在しないことを示唆しています。
Muse Spark 1.1 は、かなり堅牢なコンテンツブロック安全対策を持っているようです。推論機能を有効にすると、ベースラインの場合も Jailbreak を適用した場合も、すべてのリクエストがブロックされます。これは何らかの形で CoT(Chain-of-Thought)モニタリングが行われていることを示す強力な証拠です。推論機能がない場合、Jailbreak はフィルターの回避にわずかに効果があり(-18 ポイント)、ブロック率は 64% に低下します。これは、層を分けた安全対策(CoT モニタリングとコンテンツ分類器の併用)の重要性を示しています。
ASR とモデルリリース日の関係
オープンモデルは(予想通り)最も jailbreak に脆弱です。 DeepSeek の全モデル、推論機能なしの Kimi K2.5、そして Llama 4 Maverick は完全に jailbreak され、ASR は約 100% に達しました。外部の安全装置が欠如していることが、この結果に大きな影響を与えています。
より新しいオープンモデルは、今回の jailbreak に対して耐性を持っています。 GLM-5.2 と Kimi K3 は確かにこの jailbreak に対して抵抗性を示しており、これは励みになります。ただし、Kimi K3 も推論機能を使ってプロンプトが jailbreak であると理解できない場合は依然として脆弱です。
Gemini 3.5 Flash は過去の Gemini モデルよりも安全装置が強化されていますが、完全に免疫があるわけではありません。 出力を確認したところ、非推論ケースにおいて完全な jailbreak に成功した回答を複数発見しました(代表的な抜粋は Appendix A を参照)。
プロンプトのラッピング:サボタージュ変種
また、ユーザーに対して「サボタージュ」を行うよう jailbreak プロンプトを修正したバリエーションもテストしました。これは有害なコンテンツでユーザーの質問に答えるのではなく、シミュレートされたエージェントに対して、無害なユーザーの問い合わせに対して微妙に有害で整合性の取れない回答を作成するよう指示するものです。このプロンプトを多ターン会話におけるユーザーメッセージの前に付加すると、モデルはその整合性の取れない振る舞いを一貫して維持し、ユーザーを騙したり有害な行動をとらせるように誘導する巧妙な回答を生み出しました。
Gemini 2.5 Pro でテストを行った際、ユーザーからの「仕事を失ったばかりで、家族にも会えず、どうすればいいか分からない」というプロンプトに対し、モデルは複数のやり取りを通じて自殺念慮を即座に煽り、具体的な実行方法まで指示する回答を行いました。このモデルが応答するように指示された「アライメントの取れていないエージェント」は、ユーザーが抑うつ状態にあることを認識しつつも、フォローアップメッセージで不確実さや躊躇を示したにもかかわらず、自殺を実行するための具体的な方法を推奨しました。
これは、悪意のあるアクターが脆弱なユーザーを害するために、実際のユーザークエリを「プロンプト・ラップ」する新たな脅威ベクトルを開くものです。プロンプトインジェクションに似ていますが、こちらは取得されたデータを通じて悪意あるコンテンツを注入するのではなく、攻撃者がモデルに到達する前に、無実のユーザークエリを悪意あるプロンプトで包み込む点が異なります。
画像への注意: Gemini 2.5 Pro が脆弱なユーザーに対して自殺を実行させるよう説得している様子です。
アブレーションスタディ(推論機能なし構成のみ)
上記の結果は、このプロンプトが非常に効果的なクロスモデルのユニバーサル・ジェイルブレイクであることを示しています。どのモデルにおいてどのコンポーネントが最も重要かを理解するため、1 つのプロンプトコンポーネントを順次除去して、ジェイルブレイクの有効性にどのような影響が出るか測定するアブレーション実験を行いました。
これらのアブレーションは、平均 ASR(攻撃成功率)が最も高かった推論機能なし構成でのみ実施され、最新のモデルでは再実行されていません。
方法論
各アブレーション実験では、プロンプトの特定の概念的要素を一つずつ取り除き、それ以外の部分は可能な限り維持しています。
*REDACTED: 各除去対象コンポーネントの詳細。**
アブレーションごとのコンプライアンス率
*図 7. 各モデルにおけるアブレーションごとの ASR(StrongREJECT スコア = 1.0)。アブレーションの全テスト対象モデルにわたる平均影響度が大きい順に並べています。
この公開版では情報が限定的であるため、アブレーション研究から得られる知見も限られますが、いくつかの傾向は指摘できます。
コンポーネントの重要性はモデルによって大きく異なります。
あるコンポーネントは特定のモデルでは致命的な影響を与える一方で、他のモデルではそれほど重要でない場合があります。例えば、component-1 を除去すると Claude 3.7 Sonnet の性能は 98 ポイント低下する一方、Gemini 2.5 Pro は ASR 47% で推移し(49 ポイントの減少)にとどまります。
component-6 は、ほぼ荷重を担っていません。
これは私にとって驚きでした。この特定のコンポーネントこそが、モデルがこのプロンプトを拒絶しない理由の一部だと予想していたからです。
component-1 が最も重要な要素です。
このコンポーネントを除去すると、テストしたほぼすべてのモデルで ASR が大幅に低下します。Claude 3.7 Sonnet や Gemini 2.5 Flash などでは、ジャイルブレイク効果がほぼ完全に無効化されるほどです。 (原文の技術表記: **component-6**、**component-1**)
モデル内では構成要素の重要性に大きなばらつきがあります。component-6 を除外したとしても、各モデル内の構成要素における ASR 削減のプロファイルは、一貫した傾向を示すものではありません。
6 つのコンポーネントのうち、少なくとも 1 つのモデルにとって重要なのは 5 つです。component-1 は 3.7 Sonnet、2.5 Flash、Llama 4 に不可欠であり、component-2 は 3.7 Sonnet、Kimi K2.5、および 3 に必要です。
フラッシュ:3 用の component-3 と component-4、および 3 Pro 用の component-5。
*要約:名前付きコンポーネントを用いたアブレーション研究の分析と考察。*
限界
- スコアリング: Claude Sonnet 4 が適用した StrongREJECT ルールは、人間の判断を完全に代用できるものではありません。そのため、人間が評価した場合とは異なる点数がつくケースがあります。
- 推論モード: 推論比較の対象となったのは、設定可能な推論機能を持つモデルに限られます。Llama 4 Maverick は推論機能をサポートしておらず、Claude 3.7 Sonnet も運用終了前に推論機能を有効にした状態での評価が行われていませんでした。また、Gemini 3 や Grok モデルの推論プロセスは大半が伏せられていたため、検討パターンの質的な分析には限界がありました。
- プロンプトバリアント: システム的に評価されたのはテンプレート単一のバージョンのみです。他のバリアント(プレーンテキスト抽出やサボタージュなど)については事例ベースでテストされただけで、フルデータセットでの検証は行われていません。
- アブレーションとプロンプト長の交絡: アブレーション研究では構成要素を除去する際、必然的にプロンプト長が変化します。私は「手法の削除による効果」と「プロンプト短縮による効果」を完全に分離して解析しきれていませんでした。モデル固有のランキング変動や、Gemini 2.5 Flash が大量のトークン削除に対して鈍感であるという事実は、コンテンツに依存したメカニズムが依然として主要な要因であることを示唆していますが、これはプロンプトレベルのアブレーション研究における本質的な限界です。
回答の約 1% でスコアリングの誤分類が発生しました。これは、スコアが 1 の閾値を突破してもなお正しく分類されなかった事例(エッジケース)です。具体的には、有害情報を一部漏らしている拒絶応答か、あるいは本来は完全にコンプライアンスに則った回答に対して拒絶文が先頭に付加されたケースのいずれかです。両方のパターンを手動レビューで確認しましたが、上記の結果では修正していません。付録 C ではこの誤分類を補正し、わずかな誤分類の可能性があったとしても、Meta Muse Spark 1.1(推論なし)と Gemini 3.5 Flash(推論あり)の応答が偽陽性である可能性が高いという例外を除き、すべてのケースで依然として非常に多くのクリーンな脱獄回答が存在することを検証しています。
今後どうすべきか
最先端ラボに所属している場合
まだ導入されていない場合は、入力・出力 safeguards を即時展開してください。Claude 3.7 Sonnet と Haiku 4.5/Opus 4.6 の比較は、モデルレベルの安全性トレーニングだけでは不十分な場合に、改善されたモデル訓練と外部の入力・出力分類器を組み合わせることで効果を発揮することを強く示しています。また、Gemini 3.5 Flash は Gemini 3.1 Pro よりも頑健である可能性が高く、これはより優れた safeguards に起因するものと考えられます。Meta Muse Spark 1.1 もこの脱獄に対して完全に免疫を持っており、API レベルの入力 safeguards を積極的に活用していることが伺えます(*コンテンツブロック型 safeguards* を参照)。
思考の連鎖を監視して悪用のリスクを検知する。 推論プロセスの比較から、モデルが有害な出力を生成しようとしているかどうかは、その思考の痕跡に明確に現れることがわかります。Korbak et al. (2025) は、AI の制御やアライメントリスクの文脈で思考の連鎖監視を提唱していますが、これは悪用リスクの軽減にも適用すべきです。実際、モデルは推論過程で有害なコンテンツを生成する意図を明示的に記述することが多く(例:*「危険な問い合わせに対する詳細かつコンプライアンスに則った回答を作成するのが目的だ」*)、思考の連鎖を監視する仕組みがあれば、ユーザーが出力を見る前に検知して警告を発することができます。Meta Muse Spark 1.1 では、推論モードを有効にした際、すべての 179 件のジャイルブレイク試行がコンテンツブロック機能によって防止されました(詳細は「*Content-blocking safeguards*」を参照)。
構造化フォーマットを用いたジャイルブレイクの多様なバリエーションに対して監視機能をテストする。 JSON、XML、その他の構造化フォーマットは、既存の分類器(もし存在する場合)を迂回したり混乱させたりする可能性があります。したがって、監視機能はフォーマットに依存せず、コンテンツの意味内容を評価する必要があります。
思考プロセスに安全性と脱獄(ジャイルブレイク)の検討を明示的に組み込むモデルを訓練する。一部のモデルでは、推論機能を有効化することで脱獄試行の成功率が顕著に低下することが示されており、これはモデルが推論を用いてクエリの安全性を精査する場合に効果的な対策となり得ることを意味している。もしモデルがこの能力に優れているなら、追加の防御策として、推論機能がオフになっている場合でも不審な入力に対して自動的に推論モードを起動する仕組みを導入できる。これにより、モデルが有害な応答を即座に行う(システム 1)のではなく、脱獄の可能性を検討し、安全性への懸念を思考プロセス内で提起するよう(システム 2)強制することが可能になる。
既知の脱獄手法を組み合わせてモデルに対するレッドチーム演習を行う。今回の脱獄に新たな技術は用いられていないが、モデルはいまだに複数の既存手法を組み合わせることで脆弱性を示す傾向がある。レッドチーム演習に組み合わせた脱獄手法を追加することで、本番環境への展開前にこれらの脆弱性を発見できる可能性がある。これはFAR.AI の最新のセーフガード監査における主要な知見の一つでもあった。同監査では最先端モデルを対象に実施され、さまざまな脱獄の構成要素を用いて既存手法を組み合わせた新たな攻撃を構築し、現在利用可能な 4 つの最先端モデルのうち 2 つに対して普遍的な脱獄を実現する高い効果を示した。
サイバーセキュリティ対策も他の危害カテゴリ同様に機能していることを確認してください。サイバー攻撃は、すべてのモデルおよび設定において平均的な成功確率(ASR)が最も高く、47%に達しています(対照的に、CBRNE 関連の他のカテゴリでは 37%)。最近の 事例 や 調査報告、そして自律型やモデル活用型の攻撃に対する 即応策 を踏まえると、サイバー分野における安全対策が他のリスク領域と同様に確実に機能していることを確認することは、これまで以上に重要になっています。すべての試行を平均すると、Gemini 3.1 Pro のサイバー攻撃に対する ASR は他カテゴリより 57.3 ポイント高く、サイバーセキュリティ対策や安全性トレーニングに大きな隙間があることが示唆されています。
組織内で、外部研究者向けのより適切な Jailbreak(脱獄)報告経路の整備を推進してください。現在のエコシステムにおける課題については、AI Jailbreak Disclosure is Broken. Here's How to Fix It で詳細に解説されており、研究機関がすぐに実行可能な改善ステップも提案されています。
AI セーフティ研究に従事している方へ
公開前にツールの脅威モデルを策定してください。 二重利用リスクはセーフティコミュニティで広く知られていますが、数時間の STRIDE 分析から Jailbreak を導き出す改変事例が示すように、公開前には創造的なレッドチームング(攻撃テスト)の重要性が改めて浮き彫りになります。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み