Claude Mythosと誤解されたオープン重みモデルへの恐怖
本文の状態
日本語全文を表示中
詳細モードで約11分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Interconnects
Anthropicはサイバーセキュリティに強いClaude Mythosを発表し、オープン重みモデルへの批判が再燃した。批判者は、この強力なモデルの公開により攻撃者が容易に悪用でき、デジタルインフラが対応しきれないと懸念している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
今週、Claude Mythosモデルの発表があり、特にサイバーセキュリティ分野において非常に強力な能力が公言されていることから、オープンウェイトAIモデルに対する否定的なナラティブの新たな波が巻き起こっています。この議論の要点は、このモデルのオープンウェイト版による攻撃を多数の主体が行えるようになる前に、私たちのデジタルインフラストラクチャが準備を整えられないだろうというものです。
Mythosに関するニュースを受けて、オープンモデルへの反発は、多くの一般的な不確実性を単純で広範な政策提言に混同しており、実際にはサイバーセキュリティの準備状態をさらに弱体化させる可能性があります。
私たちは以前もこのような状況を経験しています。2019年にOpenAIがGPT-2の重み(weights)を公開しなかった際、また2023年にGPT-4がリリースされた際には、オープンウェイトモデルは極めて危険であると議論されました。これらの波はいずれも去っていきました。現在犯されている核心的な誤りは、2つの問題を組み合わせている点にあります:1)オープンモデルとクローズドモデルの格差が時間的に静的であるという受容、および 2)オープンウェイトの実現可能性を一般的に特定の課題と結びつけることです。
私は最近、最先端レベルのオープンウェイトモデルが近未来において、クローズドモデル全体の実力に追いつかないだろうという見解を長文で述べてきた。また、オープンウェイトエコシステムがこの現実を受け入れるために適応する必要があることについても記してきた。これは、特定の機能がクローズドラボで利用可能になってからオープンソース版が再現されるまでの6〜18ヶ月の遅れを、AI業界にとって「完全な祝福」と繰り返すべき時である。これは、有用なオープンソースエコシステムの存在と繁栄を許容しつつ、AIシステムの最先端を安全に監視・管理するという良いバランスだ。
私がオープンとクローズドのモデル間の時間差において焦点を当ててきた核心的な議論は、全体的な能力、つまりClaude Opus 4.XやGPT Thinking 5.Xのような汎用・最先端モデルの能力に関するものだ。これらのクローズドモデルが、多様な状況においてエージェントとして堅牢に問題を解決し動作する能力は、最高のオープンウェイトモデルの範囲外にある。オープンウェイトモデルが比較的得意とすることは、主要なベンチマークにおいて迅速に追いつくことである(これは確かに部分的には蒸留によって助けられているが、必ずしも大幅にではない)。この議論は全く異なり、オープンウェイトモデルがサイバーセキュリティに関連する特定のスキルにおいて追いつけるかどうか、そしてそのようなモデルのオープン版を世界が利用可能になるのはいつ頃かという問題に関係している。
Claude Mythosレベルのオープンウェイトモデルの事例は、コミュニティが経験した以前のいくつかの反オープンウェイトに関するナラティブよりも、私にはより微妙な問題であると言えます。GPT-4が特にバイオリスクのような分野においてより仮説的なリスクを扱っていたのに対し、サイバーインフラストラクチャが攻撃を受けやすいという明確かつ現在の現実の方がはるかに具体的です。それでも、この瞬間における多くのニュアンスは、システムが実際に何ができるか(つまりMythos)の全詳細を知らないこと、およびそれが作用する環境の状態(つまり私たちのデジタルインフラストラクチャ)にかかっています。
このリスクを適切に評価するためには、Claude Mythos規模のモデルを構築し展開するために何が必要かを知る必要があります。これには3つの要素が含まれます:1)ウェイトのトレーニングと公開、2)モデルが使い方を理解し効果的なツールを与えるハネス、3)推論用のコンピューティングリソースとソフトウェア。
共有
(以下では、私の思考過程を示すためにモデルサイズと価格の見積もりを行いますが、これらは絶対的な真実として捉えてはいけません。)
現在の推計では、Claude Opus 4.6やGPT 5.4といった主要モデルのサイズ範囲は、約3〜5兆(T)パラメータとされています。現在、中国のラボから提供されている最大規模のオープンソースモデルは、約1兆パラメータ程度です。Claude Mythosのプレビュー価格はOpusの5倍ですが、これはアクティブパラメータ数の単純な乗算増加(同じサービングシステム設計を維持した場合)、はるかに高い推論時スケーリング、推論効率を低下させるより複雑なハーネス、低い利用率の見込みなどが組み合わさった結果かもしれません。最も単純な推測は、上記のすべてが複合したものであり、パラメータ数は約2倍大きいが、サービング効率ははるかに低いというものです。これは巨大なモデルであり、おそらくGPT 4.5に類似したものですが、実際には適切にポストトレーニングされています(GPT 4.5はインフラ面において時代を先取りしていたためです)。
規模が大きくなるにつれて、モデルを実際に訓練するという課題も伴います。より大きなモデルは常に、その能力を引き出すために解決しなければならない新たな技術的問題を伴うからです。サイバーセキュリティのケースでは、私の推測では、その能力の大部分は、コーディングにおいて人間を超えた性能を持つようにモデルを訓練することで習得できるでしょう。知識労働、医療、法律などのような他の能力とは異なり、コーディングはGitHubのような公開データを用いて大幅に研究し改善することができます。私は、オープンウェイトモデルがコードの実行と処理という狭い領域においてフロンティアに近い性能を維持することに、より楽観的です。しかし、サイバーセキュリティの理解において人間を超えた性能を得るために必要なスキルの全範囲については理解していません。Claude Mythosの訓練には、どの程度の専門知識や特別なノウハウ(special sauce)が投入されたのでしょうか?これが私の影響に関する誤差範囲の大きな要因となっています。
第二に、モデルが内部でどのように動作しているかについて、私たちは何も知りません。今日のモデルは、単なる重み(weights)以上のものを伴う複雑なシステムです。それらを実行するには、Claude Codeが私たちが最も慣れ親しんでいるものですが、複雑なツールとインフラストラクチャが必要です。Mythosには、ここでの独自の革新が非常に likely にあります。
8兆パラメータを持つ最新のMoE(Mixture of Experts)モデルをサーブするために必要なGPU数の私の見積もりは、H100 GPUが約100台程度であり、そのコストは1日あたり約1万ドル(ただし、トークン/秒単位の処理速度は非常に低速である可能性がある)。さらに言えば、Nvidia GB200 VL72システムの公式マーケティングコピーには「ラック上でリアルタイムのトリリオン・パラメータモデルを解き放つ」と記載されている。Mythosは1つのラックに収まるのか?私の特定の見積もりを政策の参照として頼ることに重点を置くのではなく、最先端のAIシステムの実行には莫大な費用がかかり、ノートパソコンやセルフサービス型のクラウドポータルで気軽にできるものではないという点を繰り返すことが重要である。
モデルをダウンロードできる人々と比較すると、これらのリソースにアクセスできるアクターははるかに少ない。もちろん、まだ多くの主体が存在するが、Mythosに類似したモデルの能力が普及するために必要な詳細をすべて明確にすることが重要である。要約すると、Mythosのようなツールは、最上位の攻撃者により強力な道具を提供することになるが、インターネットに接続されたすべてのティーンエイジャーに核兵器を渡すことにはならない。
Interconnects AIは読者支援型の出版物です。購読をご検討ください。
個人的には、サイバーセキュリティの悪用が、ある能力閾値を超えるオープンウェイトのテキストモデルを公開することについて道徳的にグレーな領域となるレッドラインになり得る可能性を認めています。多くの人は、このレッドラインがGPT-2とGPT-4の間のどこかで、誤情報や偽情報の害という軸を通じてより早く訪れるだろうと考えていましたが、そこには異なるボトルネックがありました。画像生成モデルについては、入手可能なオープンウェイトモデルを用いて同意のないAIディープフェイクを可能にするという最初のレッドラインをすでに大きく超えています。私たちは、これらの懸念が過去に発生し、その後収束したという現実と、ますます高度な能力を持つ技術とのバランスを取っています。
したがって、私の誤差範囲の2番目の大きな源泉は、「実際にはどれほど悪いのか」というサイバーセキュリティの状態に関するものです。Claude Mythosのようなモデルへのプライベートアクセスを数ヶ月間得た場合、人間は最も重要なソフトウェアにおいてどれほど多くの問題を修復できるのでしょうか?また、何が決して修正されないのでしょうか?
例えば、Claude Mythosの能力に近いオープンウェイトモデルが得られた場合、それらのモデルを組織が自らのツールのセキュリティを強化するためにファインチューニングすることは可能でしょうか?
現在、オープンモデルの進歩を止める一般的な理由としてこれを断定するには早すぎます。Claude Mythosが極めて限られたパートナーにのみ閉じられている状況では、閾値に近い強力なオープンモデルが存在する方が、危険性を評価しやすくなる側面があります。不可欠な国際インフラストラクチャのセキュリティを決定するために、単一の民間企業に完全に依存することは、持続可能な均衡状態ではありません。
したがって、結論として、私は以下の三つの事項についてさらに研究することを皆様にお勧めします。
オープンモデルとクローズドモデルにわたるサイバーセキュリティ関連の能力を、どのように測定すべきか。これにより、オープンモデルは本当に6〜9ヶ月の遅れで追いついているのか、それとも他のコーディング領域においてパフォーマンスの関連性を維持しているに過ぎないのか。
Claude MythosとProject Glasswingが既存のサイバーセキュリティ上の懸念に与える真の影響を、どのように独立して測定すべきか。
もしモデルが追いついており、Claude Mythosの防御的機能が脆弱であるという場合、狭い領域におけるオープンウェイトモデルの標的型能力を、どのようにより良く監視し(必要であれば規制を試み)、管理すべきか。
この目標は、オープンモデルに対する懸念を非常に具体的なものに留めることを促すことです。ある国がオープンモデルに対して一般的な禁止令を出せば、その国は即座に、おそらく不可逆的に、重要かつ曖昧な技術に影響を与える能力を失うことになります。もし米国が最高のオープンモデルの構築を停止すれば、他の国が行い、その技術の中心地となるでしょう。オープンモデルを完全に消滅させる方法はありません。影響を与え、理解し、方向性を示すことしかできません。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み