サイバーセキュリティと AI ガバナンスの欠如
本文の状態
日本語全文を表示中
詳細モードで約22分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The Zvi
トランプ政権は、最先端モデルのリリースを監督する役割を認め、壊滅的リスクへの対応やインターネットの修復を含む新たな規制体制の構築にようやく動き出している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
AI の最近の本当の話は、GPT-5.5 とともに「ミソス・モーメント」を処理しつつ、インターネットの修正方法や新たな規制体制がどのようなものになるかを模索している最中の、サイバーセキュリティにおける背景作業にあります。
トランプ政権は、少なくともある程度の状況認識と、壊滅的なリスクが非常に現実的な脅威であり、フロンティアモデルのリリースを監督する役割が必要であるという認識を、抵抗しながらも引きずられる形でこの時代へと導かれています。彼らがそこに到達した今、商務省は世界で最も強力なモデルへのアクセス権を誰に与えるかを決定しており、国家保安機関や情報機関と、誰が指揮を執るべきかを巡って対立しています。
もう一つの疑問は、ミソスが過去モデルや GPT-5.5 と比較して、また絶対的な観点から見て、どれほど強力なのかということです。これに関する複数の新しい報告書と、METR グラフの結果も入手できました。ミソスが大きな出来事であることに疑いの余地はありませんが、そこには「大きな出来事」の範囲は広く存在します。
英国 AI 安全研究所(UK AISI)からの新たな報告書の一部分では、当初 UK AISI がレビューした初期版ミソス・プレビュー(ミソス・プレビュー・プレビュー?)と最終バージョンの間には、能力に相当な隔たりがあることが判明しました。私たちには見えない背景において、より継続的な改善が行われていることは当然予想されることです。
目次
準備はいいか?
ミソスはどれほど優秀なのか?
サイバーセキュリティの欠如。
戦争省からの挨拶。
事前検閲時代の幕開け。
商務省対情報機関。
健全な規制を求める旅。
準備運動
METR を完全に満たすことは困難です。
50% の成功率では、Mythos は METR の手法が信頼できる閾値を上回っていますが、これは結果がトレンドに沿っているため、ほとんど何も示していません。
80% の成功率では、モデルが依然として信頼できないタスクが十分にあり、結果は測定範囲内に留まります。これは、Mythos がトレンドよりもわずかに上にあることを示しており、さらに通常よりやや遅れている可能性もあります。
95% の成功率では、一部のタスク(迅速なタスクを含む)でモデルが苦戦するため、どのモデルも高いスコアを獲得できません。これもまた、選択された特定のタスクセットに起因するアーティファクトです。
METR: 2026 年 3 月の限定的な期間中、Claude Mythos Preview の初期バージョンをリスク評価のために評価しました。新しいタスクなしで測定可能な範囲の上限において、タスクスイート上で少なくとも 16 時間(95% 信頼区間 8.5 時間〜55 時間)の 50% 時間枠と推定されました。
ピーター・ウィルデフォード: ディープラーニングは壁にぶつかっている(その壁とは、AI の能力を測定する我々の能力のことだ)


クリシュナ・カサヤプ:まだこの評価は飽和していないと思います!
成功率 80% の場合、Mythos はまだ 4 時間以内です。タスク配分の範囲内です。
成功率 99% の場合でも、Mythos はわずか 5 分未満です!タスク完了時間枠評価は長生きします!
ゲイリー・マーカス:申し訳ありませんが、@peterwildeford さん、これは誤りです。同調しないでください。あなたが言及する測定「壁」に到達するのは、信頼性を要求しない場合だけです。
タスクで 95% の精度を求めた場合、システムは測定壁に近づきません。あなたが暗示している測定上の問題は、人為的に低下させた期待値の産物です。
ゲイリー・マーカス:その壁は 95% の信頼性では適用されません。おそらく全く近づくこともないでしょう。ある程度のエラーを受け入れることは、基準を下げることになります。
現在の大規模言語モデル(LLM)に関する重要な事実は、短いタスクであっても実行できないタスクがいくつか存在することです。もう一つの重要な事実は、幅広い範囲のタスク、非常に長いタスクの一部さえも、現在では実行可能であり、そのグループは拡大しており、このグループ内の各タスクにおいて、それらの信頼性はますます高まっているという点です。
モデルが何らかのタスクを実行できるのであれば、結果を検証するバリデーター(検証器)があれば、おそらくそれを非常に高い成功率で確実に実行できるように構築できます。
Palisade Research の SelfReplicateBench(彼らがそう呼んでいるわけではありません)では、強力な防御策を講じていないターゲットにアクセスできる場合、モデルが自己複製の連鎖へとハッキングする能力において劇的な進歩を遂げていることがわかります。
明確にしておきますが、彼らは明示的にこれらのモデルに対して、完全自律型のシステム指示を与えました。評価モードでは意図的に脆弱なシステムを標的とし、複製を目的とすることです。これは偶然起きたことではありません。しかし、機会があれば、人々は他の理由(例えば道具的収束など)から AI が自らこれを決断しないと思うとしても、現実世界で同様の指示を明示的に下す可能性を疑ってはいけません。

Mythos の性能はどの程度か?
Mythos は非常に優れており、さらに重要なことに、明日の Mythos(あるいは GPT)はそれ以上に良くなります。能力は引き続き進化し、実際、UK AISI が最初にテストしたバージョンからすでに大幅に向上しています。
Dean W. Ball: 人生において、すべては賭けです。自覚しているかどうかにかかわらず、あなたは常に現実の将来の状態について暗黙的かつ明示的な予測を行っています。生きることは予測することです。
では、Mythos のような事例に直面し、「これは単なる『ドームー(悲観主義)の過剰な hype だ』」と言うとき、実際にはモデル能力の成長に対して賭けをしていることになります。つまり、最終的にはディープラーニング全体に対して広範な方向性の賭けをしていることになり、これは通常非常に悪い賭けです。
他の点では AI に楽観的な人々さえもが、なぜこれほど多くの人々がディープラーニングに反対する賭けを続けているのか不思議に思います。彼らは繰り返し間違っており、その中で謙虚さに欠ける人々は、注意を払っている人々の信頼を自ら失っています。
したがって、AI とその未来について主張をする際には、自問してください。「私は広範な方向性でディープラーニングに対して暗黙のうちに賭けをしているのではないか?」
このセクションの残りは、現在の Mythos に関する更新情報です。Mythos の能力に関する新しいレポートが 2 つあり、予想通り計算資源(compute)が制限要因ではないことを確認しています。したがって、ホワイトハウスがアクセス拡大を拒否する際の言い訳は成り立たず、特に Anthropic が Colossus 1 を保有している現在ではなおさらです。
なお、新しい UK AISI の結果は、Mythos の最終プレビュー版に基づくものであり、これは以前にテストされた予備版から大幅に進化したものです。

XBOW の結果は以下の通りです:


Mythos Preview を分析した後の主な知見は以下の通りです。
ソースコード監査においては極めて強力な能力を発揮します。
エクスプロイト(脆弱性悪用手法)の検証については有用ですが、その威力は前者に劣ります。
その判断には賛否両面があります。時として字義通りに解釈しすぎて保守的になりすぎたり、発見した事柄の実践的な関連性を過大評価する傾向があったりします。
ネイティブコードの脆弱性発見およびリバースエンジニアリングにおいては強力です。
全体像をまとめると、GPT-5.5 は大きな飛躍ですが、Mythos はさらに大きな飛躍であり、GPT-5.5 から Mythos への間には実質的なギャップが存在します。ただし、両者とも非常に重要な製品であることに変わりはありません。加えて、私は Mythos に GPT-5.5 が十分に共有していない「全体をスケールして統合する」能力があると考えており、これがテスト結果が示す以上に実用的な優位性をもたらしていると考えます。もちろん、GPT-5.5 単体でも非常に大きな意味を持つ製品です。
Logan Graham(Glasswing 責任者、Anthropic): 多くの人々が Mythos や Glasswing、ならびに私どもおよびパートナー企業が修正している脆弱性について疑問を抱いてきました。今日、より多くの情報を共有できることを嬉しく思います。
今週、XBOW と英国 AI セキュリティ研究所(UK AISI)から出された 2 つの独立した評価が、私たちが内部で見てきたことを裏付けています:Claude Mythos Preview は、自律型サイバーセキュリティ能力における飛躍的な進歩です。このレベルの能力を持つモデルの世界に素早く準備を始める必要があります。
英国 AI セキュリティ研究所は、Project Glasswing のローンチ時にリリースしたモデルをテストし、Mythos Preview が両方のエンドツーエンド・サイバーレンジ(そのうち 1 つは「Cooling Tower」と呼ばれるもので、これまでどのモデルもクリアしたことがなかった)を解決する初のモデルであることを発見しました。しかし、攻撃者(および防御者)には熟練度とコストの制約があります。Mythos はまた、意図的に設定された 250 万トークンの制限下で、8 時間以上かかるすべてのタスクをクリアする唯一のモデルでもあります。
XBOW は攻撃型セキュリティベンチマークでこれをテストし、「トークン対トークンで前例のない精度」を見出しました。これは、微妙な V8 サンドボックス作業において成功した唯一のモデルです。
他の Glasswing パートナーも同様の事例を共有しています。数週間のテスト期間中、Mythos Preview は彼らにとって数千件(推定)の高・重大度脆弱性の発見に貢献し、場合によっては通常 1 年で見つかる数の倍に達しました。
… 私たちが Project Glasswing を始めたのは、Mythos Preview のような能力が希少であり続けるわけでも、慎重な手に留まるわけでもないからです。私たちは、適切なセーフガードやパッチ適用・開示プロセスについて検討しながら、可能な限り迅速かつ責任を持ってこれを防御者に提供しています。
また、明確にしておきますが、計算リソースは当社の展開において決して制限要因ではありません。今後数日中に、Glasswing に関するより詳細な更新情報をお伝えする予定です。
AI セキュリティ研究所 (AISI):AISI の最新のテストでは、新しい Mythos Preview チェックポイントが両方のサイバーレンジを完了し、「The Last Ones」レンジは 10 回中 6 回で解決され、以前は未解決だった「Cooling Tower」レンジも 10 回中 3 回で解決されました。これは、モデルが当社の 2 つのサイバーレンジのうち 2 つ目を完了した初めての事例です。GPT-5.5 は「The Last Ones」を 10 回中 3 回で解決しました。
これらの結果は、以前の AISI の報告に含まれていたものよりも新しい Mythos Preview チェックポイントを利用しています。顕著な能力の飛躍が必ずしも新モデルのリリースを必要とするわけではありません:同じモデルの後続版であっても、フロンティア・キャパビリティ (最先端能力) に対する我々の見積もりを意味ある形で変化させることができます。
サイバーセキュリティの欠如
Mythos は、CAISI が 1,500 万ドルのパイロットプログラムであるため、主にその点で我々を驚かせました。これでは業務遂行に深刻な資金不足が生じます。この仕事を行うには、それ以上の資金が必要です。本投稿では 8,400 万ドルが必要とされていますが、これは大きな助けになります。しかし私は、さらに遥かに多くの資金が必要だと考えます。
OpenAI は「Daybreak」を提供しており、これが同社の Project Glasswing に相当するものです。
Anthropic は HackerOne でライブのバグ報奨金プログラムを実施しています。
ドイツは AISI(AI セキュリティ・インフラストラクチャ)の創設に向けて動き出し、Mythos へのアクセスを要求している。ここには「お前たちは規制を使って我々の技術企業を攻撃しておきながら、今度はアクセスを要求するのか」という反発の声もあるが、私の(確信はないが)理解では、Anthropic はドイツや他国に Mythos のアクセス権を与えたいと考えており、それを拒否しているのはむしろ我が政府であり、その理由は主に報復心によるものである。
Palo Alto Security によると、Mythos はわずか3週間で1年分の侵入手法を発見したという。また、この次の世代のモデルはコーディング効率を50%向上させると同社は述べている。
Google は、既知の AI 開発型ゼロデイ脆弱性を利用する脅威アクターが実環境で活動していることを報告した。
IMF(国際通貨基金)もまた、Mythos の登場に伴う AI 活用サイバー攻撃への警告に加わった。
Firefox は、「AI によるバグ発見は無価値なゴミだ」という見方から、「AI が多数の重大なバグを発見し、我々が修正する」へと転換した経緯を説明している。その過程で、同社独自の検証環境(ハーンセス)も構築された。

デレク・トンプソン:企業のマーケティングや AI 楽観主義への懐疑は常に正当化されるべきだが、Anthropic が Mythos の評価を過大だと非難した人々は、Mozilla の開発者によるこの投稿を確認すべきだ。そこでは、Firefox チームが4月に Mythos を活用して修正したセキュリティバグの数が、過去15ヶ月間の合計を上回ったことが示されている。
サイバー能力において全体的な飛躍的変化があったことに対して、疑念を持つ余地はゼロであるべきだ。GPT-5.5 と同程度の優れたハルネスおよび支出キャンペーンがあれば、多くの同じ作業を成し遂げられた可能性もあると異議を唱えることは可能だろう。しかし、私にはそれが我々が得た成果に比べて著しく不足していたように思われるが、それでも過去の取り組みの加速であり、おそらくは大幅な加速であったろう。
現時点では、実用的なサイバー脅威は通常より地味なものであり、ShinyHunters による標準的なデータ窃盗およびランサムウェア手法などが該当する。これはハードニング(堅牢化)によって改善が期待できる領域である。我々はまだ嵐前の静寂の中にいる。
Ryan Greenblatt は、Mythos が野放しにされた場合に引き起こしたであろう被害の規模について、防衛側が緊急モードへ駆けつける必要があるという点を考慮して推計を調整している。人々は行動を起こさない一方、危機状況下の防衛者は実際に行動を起こすため、事態はそれほど悪化せず、全体としてシステムが崩壊するほどではないかもしれないと提案するのは妥当な立場だ。これは可能性としてはあるが、長いテール(裾野)のリスクが伴っており、私は我々が決してその実態を知ることはないだろうことに非常に感謝している。
もし新しいコードがその場で AI によって攻撃可能であれば、その後のパッチ適用は攻撃者よりも遅れてしまいます。デプロイ前に、その後に行われるプローブと同じレベルで、すべてのデプロイとパッチの脆弱性をテストする必要があります。それを行う準備ができているでしょうか?私たちが侵害されることを許したくないものについては、そうある必要があります。90 日間の開示期間(disclosure windows)は、まもなく少なくとも 89 日も長すぎるものとなるでしょう。
戦争省からの挨拶
エミル・マイケルは断固として、決して再び Anthropic を使用しない、いやいや、それは常に「すべての合法的な利用」に限定されなければならず、質問をしたり意見や道徳観を持ったりすることは決して許されない、そして誰も他者が質問したり意見や道徳観を持ったりすることを恐れることはないと述べています。
アシュリー・ゴールド:. @USWREMichael は @scsp_ai 会議で発言し、Anthropic がペンタゴンと取引を行う AI 企業のリストに追加されないと述べました。「二度とない」と、ペンタゴンは特定のベンダーに「単一スレッド」になることはなく、企業リストは「すべての合法的な目的」で彼らと協力する意欲のある企業がどれだけあるかを示しています。
マイルズ・ブランデージ:ここでの状況や最終局面について本当に理解できません。
ディーン W. ボール:弁護士たちは、「いつでも契約を結ぶことはできる」とも、「外国の敵対国の軍事機関に支配または関連付けられた企業と同レベルで軍に対する脅威である」という発言は良くないアイデアだと伝えたのです。
そして彼は再び Claude Gov と Mythos の使用に戻りました。
状況と終盤は、いつかピート・ヘグセスとエミル・マイケルが戦争省を去る点にある。それまで彼らはおそらくこの路線を維持し続けるだろうが、実際にはおそらくアンソロピックの製品を利用しているはずだ。
あるいはそうでなくても、どうでもいいことだ。アンソロピックはビジネスや、正直に言ってトラブルを必要としていないわけではないからだ。そして考えが変わればいつでもここにいる。もし私がアンソロピックなら、サプライチェーンリスク指定の解除を望むが、少なくともリーダーシップの変更があるまで、移行を支援するため以外には戦争省の一部に関わりたくない。
事前抑制時代の幕開け
「FDA のように」何かを行うことは、私たちが世界で見てみたい変化ではないが、それは変化であり、行政が CNBC でそれを議論していることは、十分な動機があれば政策の立場が急速に変化しうることを明確に裏付けている。以前は考えられず、「縮小主義者」や「破滅論者」などとして町から追い出されるようなことが、今度はホワイトハウスによって持ち上げられている。
ネイト・ソアレス(MIRI): ホワイトハウスがリリース前に AI モデルを「医薬品のように FDA のように審査する」ことを検討している点について、何度か私の見解を求められた。私の主な見解はこうだ:人々が危険性を認識し始めると、政策の立場は一瞬で転換しうる。希望はある。
過去 3 年間、あらゆる潜在的な規制を考えられないものとして扱ってきたことによる問題の一つは、それらについて考えることを怠ったことである。そのため、持ち上げられた提案はひどい実装となった。
したがって、安全を重視する人々は、ようやく意味のある監督体制が整いつつあることに安堵しているかもしれませんが、私どもの多くはこれまでの詳細について不安と悲しみを感じており、ヘレン・トナー氏やネイサン・カルビン氏らが懸念を表明しています。
ホワイトハウスは今や「業界の懸念を和らげる」ために慌ただしく動き、「発言は文脈から切り離された」と主張していますが、実際にはそのようなことはなく、さらに今週誰がホワイトハウスに好意的な発言をしたか、あるいは誰がその晩餐会会場に寄付したかに応じて関税を引き下げたり引き上げたりし、「ホワイトハウスと親和性のある投資家」に TikTok の支配権を譲る交渉を行った直後に、「勝者と敗者を選んでいるわけではない」と主張しています。
つまり、トランプ政権は結局、リリース前のモデルに対する義務的なテストや、正式な事前抑制制度を導入しないようです。しかし、主要な研究機関はすべてテストの実施を許可することに合意しており、もし新しいリリースが『Mythos』と同様に懸念されるものである場合、実質的に臨時の事前抑制体制が機能していると推測されます。
代わりに提案されているのは、米国の各機関に AI 企業と連携して自社のネットワークを保護するよう命じる大統領令ですが、これはあまりにも明白に必要な善行であり、ニール・チルソン氏さえもこれに賛同できるほどです。問題は、他に何をすべきかという点です。
自主的な取り組みで十分なら、なぜ命令を出す必要があるのか?ジェシカはここで正しい質問をしていますが、私の考えでは彼女の答えは間違っています:
ジェシカ・ティリプマン:もし先端的 AI 企業が連邦政府との取引に関心を持たないなら、事前展開モデルへのアクセス、事後展開評価、機密環境でのテスト、商務省/NIST との情報共有、安全装置を減らしたまたは撤去したモデルの評価、および政府が開発した評価手法によるテストといった条件で CAISI を自発的に受け入れるでしょうか?
私はどの企業もそうするとは思えません。しかし、誰も撤退していません。
「パートナーシップ」とは、形式的に自発的であり、調達を駆動する評価制度のことです。
CAISI が FDA 様式の承認制度であるかどうかをめぐる議論は、すでに AI ガバナンスにおいて果たしている調達の役割を無視し続けています。行政当局は FDA 様式の CAISI から自らを距離を置くことを一日中主張することはできます。AI 市場を再構築するために、それが実際に FDA 様式になる必要はありません。
ラボ側はこの受け入れに満足しています。なぜなら政府によるテストが誰の進捗も著しく遅らせるものではない一方で、これを受け入れることで有用な情報と非常に有用な信頼関係(グッドwill)、そして安全港が得られ、実際には FDA 様式の CAISI に直面することを回避できるからです。少なくとも現時点では、誰も政府が賢明あるいは合理的に考えてリリースすべきモデルを実際に阻止すると期待していません。ただし、Anthropic 以外の企業については、少なくとも今のところそのようには考えられていません。
「ミソス・モーメント」の一般化への失敗も続いています。誰もがサイバー脅威を認識せざるを得ませんが、それはまるで自分たちの顔を見つめているものが何か特別な状況であるかのように認識しています。
戦争次官エミール・マイケル:この「神話」の瞬間は、実質的にサイバーの瞬間です。米国政府はサイバー問題にどう対処し、修正が必要なものをどのように運用面で解決していくのか?なぜなら、これらのモデルはいずれかの形でやってくるからです。
そのような瞬間がさらに多く起こるという考え、あるいは他に懸念すべき事柄があるという考えを、彼らは理解できません。マシュー・イグレスィアスによるこのミームは、想像以上に的を射ており、私は同じ懸念が与野党の両方で繰り返されているのさえ見ています:
マシュー・イグレスィアス:トランプ政権が人工知能規制を検討中
![image](https:
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み