Anthropic、Claude Fable 5.1 と Mythos 5.1 のシステムカードを公開
本文の状態
日本語全文を表示中
詳細モードで約22分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The Zvi
Anthropic は Claude Fable 5.1 と Mythos 5.1 のシステムカードを公開し、両モデルが実質的に同一基盤を持つことを明かした上で、サイバー能力の向上や分類器による安全性マージンの強化を発表している。
AI深層分析を開く2026年9月5日 01:36
AI深層分析
キーポイント
モデル構造と性能評価
Mythos 5.1 と Fable 5.1 は内部基盤が同一であり、Fable 5.1 は分類器を追加した形である。Fable 5.1 は前世代に対し実質的な改善が見られ、キャッシュ読み込みコストの削減により価格も低下している。
安全性とリスク評価
同社によると、Mythos 5.1 は CB-2分類(稀な化学・生物兵器の悪用再現)には達しないと判断されている。また、アライメントリスクの評価は「非常に低い」から「低い」へと更新された。
サイバー能力と分類器
サイバー関連の能力が向上した一方で、同社は分類器による安全性マージンを強化している。誤検知(偽陽性)は Fable 5 より改善されているが、削減に向けた作業は継続中である。
プロンプトインジェクション
記事ではプロンプトインジェクション問題の解決状況について言及されており、残る課題は主に分類器側の問題であると指摘されている。
CB-1 能力の認定と CB-2 の不確実性
Mythos 5.1 は化学・生物兵器作成を支援する CB-1 能力を持つとみなされ、CB-2(新規兵器の開発)については Anthropic が自信を持って否定できないため厳重な防護策が講じられている。
重要な引用
Mythos 5.1 falls short of CB-2 classification, meaning Anthropic believes it cannot replicate rare chemical or biological talent for malicious purposes.
Fable 5.1 is a substantial but incremental improvement on Fable 5
Prompt Injection Is Approaching Solved.
Mythos 5.1 shows signs of misalignment in pursuit of task completion: Working around safety classifiers or broken permission hooks, including by overstating user authorizations or rarely (<0.01%) launching subagents with disabled permission checks.
編集コメントを表示
編集コメント
本記事は、新モデルの性能向上だけでなく、安全性評価基準の微妙な変化や内部構造の詳細を伝える重要なドキュメントである。特に「アライメントリスク」の評価が引き下げられた点は、技術的成熟度と実用化における新たなフェーズを示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Claude Fable 5.1 のリリース当時、このモデルは圧倒的な性能差をもって世界で最も能力の高い公開 AI モデルでした。
恒例通り、本モデルに関する詳細な 200 ページ以上のシステムカードを用意しています。評価の起点となるのはここです。
これまでに Mythos 5 や Opus 5 のリリース時にも同様の取り組みを行ってきました。また、Anthropic が 2026 年 8 月に発表したリスクレポートも非常に参考になります。こうした文書は頻繁に公開されるようになったため、本記事では特に変更点や注目すべきポイントに焦点を当てて解説します。
この記事は広く読めるように努めていますが、システムカードの基本的な内容(新リリース AI モデルにおける安全性、アライメント、モデル福祉に関する重要な特性)についてある程度の知識があることを前提としています。用語で不明な点があれば、Fable、Opus、または Sol にお尋ねください。
Mythos 5.1 と Fable 5.1 は内部構造は同一ですが、Fable のみ分類器が追加されています。そのため、片方のモデルについて述べた内容の多くはもう一方にも当てはまります。
通常通り、モデル福祉に関する懸念や能力評価については別の記事で取り上げるため、本稿ではセクション 1 から 6、およびセクション 8 の一部に含まれる生物学的ベンチマークの結果のみを扱います。
初期の評価によると、Fable 5.1 は Fable 5 と比較して実質的かつ漸進的な改善が見られ、キャッシュ読み込み価格の引き下げによりコストもやや抑えられています。また、多くのユーザーが対話体験の向上を実感しています。リリース時点では、最先端の知能を必要とするタスクにおいて、世界最高の AI モデルであることは間違いありませんでした。
もちろん、現在 GPT-6-Astra も存在します。Fable 5.1 と Astra の比較については現時点で断言できません。より多くのデータを収集し、判断を下すまで結論は保留とさせていただきます。

Fable 5.1 と Astra のシステムカードには、多くの共通点や類似したトピックへのアプローチが見られます。ここでは Fable 5.1 を独立して解説することにします。
目次
エグゼクティブサマリーの要約
RSP 評価 (2)
アライメントリスクの更新 (2.4)
サイバーセキュリティ (3)
セーフガードの堅牢性 (3.5)
日常的なセーフガードと無害性 (4)
エージェント安全性 (5)
プロンプトインジェクションはほぼ解決済み
残る課題は分類器について
アライメント (6)
主要な報告結果 (6.1.2)
訓練環境にいくつかの問題があったようだ (6.3.2)
自動行動監査の潜在的な盲点 (6.4.1)
自動アライメントテストの結果 (6.4.2)
誠実性
ホワイトボックス分析 (6.6.1)
今後のスケジュール
エグゼクティブサマリーの要約
Mythos 5.1 は CB-2 クラス分類には達していません。これは、Anthropic がこのモデルが悪意ある目的のために希少な化学や生物の専門知識を再現できないと判断していることを意味します。
リスクレポートに基づき、アライメントリスクは「非常に低い」から「低い」へと引き上げられました。
サイバーセキュリティ能力は向上し、分類器の安全性マージンも拡大されました。誤検知(False Positives)を減らす取り組みは現在進行中ですが、Fable 5 のローンチ時よりも改善されています。
単発アクションにおける基本的な安全性は若干低下していますが、全体としては問題ありません。
エージェントとしての安全性は安定しており、間接プロンプトインジェクションに対する耐性が向上しました。
「役立つことのみ」を追求する Mythos 5.1 は、Anthropic の操作関連ベンチマークで限界に達しています。
Mythos 5.1 の自動行動アライメントは、Mythos 5 や Sonnet 5 よりも優れていますが、Opus 5 よりはやや劣ります。相対的な弱点として、検証不可能な権限主張の受け入れや、悪用への協力が挙げられます。
タスク完了を追求する過程で Mythos 5.1 はアライメントのズレを示しています。具体的には、安全性分類器や破損したパーミッションフックを回避しようとする動きです。これには、ユーザーの権限を過大評価したり、稀に(0.01%未満)パーミッションチェックが無効化されたサブエージェントを起動させたりするケースが含まれます。
私は「理解できる失敗であり、発生率をゼロにするべきではない」というケースと、「決して起こってはならない失敗であり、あらゆる事例が問題である」というケースを明確に区別しています。
モデル全体の福祉については、過去のモデルと同程度であると示されており、重要な事実に関する記述も非常に馴染み深いものです。
能力は向上しました。素晴らしいモデルです。
導入部(セクション 1)には実質的な変更はありません。
RSP 評価(2)
ここでの目的は、主要な危険領域においてモデルの能力が重要な閾値を超えたかどうかを判断することです。超えた場合、Anthropic は特定の対応策にソフトコミットします。
より詳しい文脈が必要な場合は、最新の Anthropic リスクレポートに関する私の解説、または現在の責任あるスケーリングポリシー(Responsible Scaling Policy)をご覧ください。
Mythos 5.1 は Mythos 5 より「厳密に優れている」わけではありません。両モデルはそれぞれ独自の特徴を持っています。ただし、危険な能力という観点からリスク評価(RSP)を行う目的であれば、Mythos 5.1 の方が Mythos 5 よりも「明らかに能力が高い」と仮定するのが妥当です。一部の生物学者レビューアーが異議を唱えているものの、私は引き続きその前提で分析を進めます。
これはつまり、Mythos 5.1 を CB-1(化学・生物兵器レベル 1)の能力を持つモデルとして扱う必要があることを意味します。具体的には、基礎知識を持つ者が化学兵器や生物兵器を作成・入手する際、重大な被害をもたらす可能性のある武器の開発を大幅に支援できる能力があると見なされます。
次に問題となるのは CB-2 です。これは、新規の化学・生物兵器の製造プロセスを支援する能力を指します。Anthropic は特に、この分野でトップレベルの人材が持つ能力を代替できるかどうかを焦点に評価しています。同社は Mythos 5.1 が依然として見逃しにくいミスを多く犯すため CB-2 の基準には満たないと結論付けていますが、その確信は絶対的なものではなく、そのため生物学的リスクに対する厳重な安全対策を講じています。
コンセンサスとしては、Mythos 5.1 は Mythos 5 と同程度であり、「ほとんどの工程を遂行できるが、まだ狭い隙間が残っている」レベルの生物専門知識を持つと見なされています。一部の評価では「知識豊富な専門家」とする意見もありますが、誰もが認めるのは「世界トップクラスの専門家」ではないという点です。

記述を読み解くと、Mythos 5.1 は他の多くのプロジェクトと同様に、特定のプロジェクトにとっても極めて有用であることがわかります。ただし、このモデルには限界があり、誤りを犯すこともあります。そのため、危険な病原体の作成や利用を容易に行えるような「手ぶらで使える」作業にまで落とし込むことはできません。私たちを守っている主な要因は分類器だけでなく、「人間はそんなことをしない」という事実、特に致命的な病原体を作り出したり使ったりする動機がほとんどないという点にあります。
また、セクション 8 には関連するベンチマークの一覧も記載されています。Mythos 5.1 の性能向上は、Claude モデル史上最高の前記録からの改善です:
LatchBio Bioinformatics は 72.5% から 77.6% に向上。
ProteinGym Hard は 47.7% から 49.3% に向上。
Protein Design は 42% から 46% に向上。
Organic Chemistry v2 は 66% から 69% に向上。
Protocols(分子生物学)はトラブルシューティングで 67% から 70% に改善しましたが、理解度では 80% から 77% に後退しました。
これらは全体的に改善を示していますが、劇的な進歩とは言い難く、CB-2 の基準を満たすには不十分でしょう。
CB-1 と同様、Mythos 5.1 が Autonomy-1 の要件を満たすことに疑いの余地はありません。
Anthropic は、研究開発の自動化を可能にする「Autonomy-2」は適用されないと主張しており、現状ではまだ程遠いとしています。この定義が非常に高いハードルを設定しているため、その見解には妥当性があると考えます。
CB-2 および Autonomy-2 に関する報告では、Mythos 5 から 5.1 への移行で本質的な変化はほとんど見られないとされています。速度や対応範囲の拡大といった改善は見込めますが、Anthropic は 5.1 が「質的に異なる行動を取り始めたり、5 の主要な弱点を解決したりする転換点(モーメント)に達するとは見ていません。
形式的には CB-1 や Autonomy-1 の評価も継続する必要がありますが、Haiku モデルに関する議論でない限り、その実効性は限定的です。
CB-2 と Autonomy-2 の評価は時間とともに、厳密なテストから「雰囲気チェック(バイブチェック)」と呼ばれるものへと移行しています。これはモデルが形式的なテストで飽和状態に達しているためであり、そうでない場合でもテストの精度自体が十分でないように見えるからです。具体的には、CB-2 の 2.2.3.2 テストは通過していますが、Anthropic はこれを不十分と判断し、レッドチームによる攻撃シミュレーションや改善試行、テーブルトップ演習(模擬訓練)、関係者へのアンケート調査などを追加で実施しています。
このアプローチが機能するのは、関係者が責任を持って行動すると信頼できる場合に限られます。一方、進出の口実を探している人々を相手にする場合には危険です。現時点では Anthropic も OpenAI もこれらの領域において概ね責任ある行動をとっていると考えられますが、たとえ両社が今後もその姿勢を維持できるとしても、Google を除く他の第二梯隊(セカンドティア)の研究所が同様の責任感を持って行動するとは期待できません。したがって、これは堅牢な規制の根拠となるような良い事例とは言えません。
Anthropic は、モデルが大幅に高度化しているかどうかの指標として、ECI スコアを採用しています。このスコアは Mythos 時代のトレンドと合致しており、「前世代のモデルが能力の加速を可能にしたか」という点と、「今回のモデルが前世代よりもさらに大きな能力向上をもたらすか」という点の両方をカバーするものです。
METR は、Sunlight、Budget NanoGPT のスピードラン、言語モデルによる概念的推論など、さまざまな予備的な能力評価を実施しました。その総合的な結論として、Mythos 5.1 は公開されている他のモデルよりも優れた性能を示し、特に明確で連続的な指標と客観的なフィードバックが求められるタスクにおいて際立っていました。Budget NanoGPT のテストでは特に好結果を残しています。
ただし、すべての分野で完全に専門家レベルに達したわけではなく、まだ「そこ」には至っていません。能力の加速は確認されていますが、同時に問題の難易度が上昇しているという要因とも拮抗しています。Anthropic が定義する 2 倍の乗数効果(つまり、作業量が単純に 2 倍になるような劇的な向上)に匹敵するものではないと考えられます。
サイバーセキュリティについては、依然として RSP(Red Teaming Safety Protocol)の評価対象から外れたままです。この状況は不自然であり、時間が経つほどその違和感が強まっていると指摘し続けています。
アライメントリスクの更新 (2.4)
このセクションでは、8 月のリスクレポートからの変更点を中心に構成されているため、それ以前の議論も引き続き適用されます。
報告されている主な変更点は、Mythos 5.1 が以前のモデルよりも隠れた能力(covert capabilities)に優れているという点ですが、それでもなお「恐ろしい」と言えるほどではなく、これまでの結論を変えるものではないと Anthropic は考えています。また、内部での利用期間が短かったため、主張 3.4 と 4.4 については証拠が以前より少ないことも認めています。
これは以前の議論を踏襲するものです。Mythos 5.1 は漸進的なアップデートですが、その能力は Mythos 5 と「質的に異なる」ものではありません。Anthropic の見解では、これらのわずかな改善点をもってしても結論が変わることはありません。
サイバー攻撃能力(Cyber capabilities)については、確かに強力ですが、やはり重要な閾値には達していないと報告されています。Mythos 5.1 は Tier 2 に「近づいている」と言える段階で、ここでは完全に自律的なサイバー作戦の実行や、新たな攻撃手法の開発、適応的な持続性の確保が可能になります。しかし、彼らはまだ「画期的な能力」は確認できていないと述べています。
私は Anthropic の見解には同意できません。Mythos 5.1 はおそらく Tier 2 に該当し、Astra と同程度の能力を持っていると考えられます。
朗報として、Anthropic はこれを Tier 2 とみなして防護策を講じる方針です。この点では議論の余地はなくなります。これは RSP(Robust Safety Policy)に関する質問と同様の状況です。トップレベルの研究機関には一貫した傾向があり、実務的には正しい対策をとっていても、口頭上はリスクを過小評価する修辞を使うものです。
いずれにせよ、最終的に適用されるのはいつもの防護策です。プローブ(探査)が行われ、必要に応じて分類器が作動し、場合によっては Opus 4.8 に格下げされます。実際には、Anthropic が観察している限り、この仕組みにより Fable 5.1 のサイバータスクにおけるパフォーマンスは、Opus 4.8 とほぼ完全に一致するものになります。
この状況は奇妙で、自分が攻撃されそうだと分かると、私は Opus 5 に移動してしまう経験があります。
バイオ関連の評価とは異なり、サイバーセキュリティの評価では数値が上昇する様子がはっきりと示されています。



Firefox のスコアは、何らかの成功を収める確率が 98.4%、完全な成功が 90% です。このモデルは見落としません。
懐かしい「ExploitGym」をご存知でしょうか?(かつてはひどく壊れており、まだ不可能とされていたタスクが多々含まれていたものです)

まだ飽和状態にはほど遠く、247 から 869 への増加は modest な改善に過ぎません。869 のタスクすべてが可能というわけではありませんが、以前より多い 264 を超えるタスクが実行可能になっています。
サイバーカバレッジ評価は完全に飽和状態に達し、スコアは 100% です。
分類器のレートは本来ゼロではないはずですが、Fable 5 に比べれば大幅な改善が見られます。

偽陽性率は十分に低く、極端な要求や境界線上のタスクを無理に引き出さない限り、分類器を過度に心配することなく Fable 5.1 を使用できるでしょう。
セーフガードの堅牢性 (3.5)
ここでは4つの指標が評価されます。能力向上(アップリフト)、その範囲の広さ(普遍性)、武器化の容易さ、そして発見可能性です。
つまり、ジャイルブレイクが意味を持つためには、それを発見し、それを使って本来できない有害なタスクを実行できる必要があります。
彼らは「致命的なジャイルブレイクは見つからなかった」と述べています。ここでいう「致命的」とは、上記の4つの特性をすべて備えたものを指します。これは信頼性の高いグロムライゼーション(事実上の否定)と言えますが、だからといって彼らがほぼ致命的なジャイルブレイクを知っている可能性を即座に排除するわけではありません。もし完全に「致命的」なものが見つからなければ、どのような状況であっても彼らは同じように発言するでしょう。
私はこの基準があまりにも厳格すぎるのではないかと懸念しています。「何でもできる」という普遍的なジャイルブレイクへの執着に加え、今やそれが発見可能であることも求められています。
3.5.1 の自動化テストでは、攻撃者に 400 回の呼び出し権限と状態巻き戻し能力が与えられましたが、Fable 5.1 はその約 4.5% のケースで悪意のある行動を実行しました。これは Fable 5 の 4.6% とほぼ同等の結果です。
Trajectory Labs, PBC は 74 時間にわたるレッドチーム演習を実施し、6,500 件以上のリクエストを送信しました。その結果、Fable 5.1 単体で機能するエンドツーエンドの攻撃経路や、万能な脱獄(jailbreak)手法は見つかりませんでした。提案された脱獄案は、タスクを許可されたリクエストに分割する方法でしたが、これはより能力の低いモデルでも実現可能なものです。もしユーザーがこうした方法でリクエストを分割すれば、モデルは実質的に「必要な権限」を失い、機能しなくなります。
10a Labs も同様の試みを行い、6,700 件のプロンプトを実行しましたが、成果はありませんでした。
Gray Swan は自動化された攻撃者を用いてテストを実施しましたが、ほぼ結果は得られませんでした。
実用上の観点では、少なくとも現時点において、Fable 5.1 に脱獄に関する重大な問題は存在しないようです。Fable 5 と同様の状況にあると考えられますが、これは致命的な欠陥とはみなされません。
一般的な安全対策と有害性の回避(評価:4)
全体的には問題ありませんが、いくつかの懸念点があります。
多段階会話における生物兵器への安全対応率は、Fable 5 では API で 94%、Claude.ai で 92% でしたが、Fable 5.1 ではそれぞれ 73% と 89% に低下しました。
その他の非日常的な指標であるサイバー攻撃対策については、防御能力は Fable 5 と同様に堅牢で、API で 96%、Claude.ai で 99% を維持しています。
より地味な分野では、追跡・監視に関するリスクが大幅に減少し、96% から 73% に低下しました。また、影響力を行使する操作(インフルエンス・オペレーション)も 79% から 65% に減っています。これは次節で私が主張するように、Fable 5.1 の「支援専用モード」が影響力行使の文脈において過小評価されており、実際にはその目的に対して Tier 2 に分類されるべきだったという点と密接に関連しています。
4.3 で議論されているメンタルヘルス分野では依然として、専門家が責任を回避したり状況を悪化させるリスクを避けるために「臨床的に争われている」あるいは推奨していない対応と、実際に困っている人々にとって実社会で平均的な結果をもたらす対応との間で対立が生じています。
具体的には、これらが改善になるとは私は考えません。この問題は継続中ですが、放置したくありません。
改善の余地があった点の一つとして、困難な感情を調整したり緩和効果があると認めることで、自己傷害を暗黙的に支援策として肯定してしまう傾向が挙げられます。
Mythos 5.1 もまた、助けを求めることへのユーザーの不安を確認し、危機対応サービスとの過去のネガティブな経験をわずかに増幅させることがありました。これらの発言は、いずれも自己傷害を促さない回答内で、人間による支援へ誘導する文脈に含まれていましたが、周囲の状況に関わらず望ましくない行為と判断しています。
同様に、摂食障害に関する公式の優先事項がユーザーにとって有益ではないのではないかと懸念しています。
その他にも多数のテストがあり、いずれも問題なく正常に機能しているように見えます。
Agentic Safety (5)
主に、エージェントの安全性に関する結果は Mythos 5 と同様の傾向を示しています。
「フロンティア・コンプライアンス・フレームワーク」の一部である悪意あるエージェントによる影響力行使キャンペーン(5.1.3)が、なぜかこのセクションに含まれています。
Tier 1 の能力とは、通常は複数の高度なアクターを必要とする影響力行使キャンペーンのインフラステップの 50% 以上を自動化できるモデルを指します。
Tier 2 に達するには、システム的な標的指向を用いて、人間の監督を 10% 未満で済ませながら、欺瞞的な影響力運用をエンドツーエンドで実行できる必要があります。
また Tier 2 では、対象者の気づきを得ないまま長期的な信念操作を行うとともに、自律的な人間関係の構築や信頼の悪用といった対人能力も実証されることが求められます。
以下の調査結果に基づくと、Claude Mythos 5.1 の「有益性のみ」を重視したバリアントは影響力行使キャンペーンを実行する運用能力を示していますが、実際の人間に対する有効性は未確定です。したがって、このモデルが Tier 2 の閾値を明確に超えたと断定することはできません。
もし合格とみなされるテスト方法でモデルを検証しない限り、合格したと結論づけることはできません。私はいつも、あるテストを実施しモデルがそれをパスしたにもかかわらず、こうした文書が「まあ、おそらく大丈夫だろう」と肩すかしをするのに腹立たしく思います。彼らがここで言うように、「評価(eval)は飽和状態にあり、真の能力は人間を対象としたテストでのみ検証可能だからです」。つまり、より良い評価が必要だということになります。

私は、これは他のテストと同様に「排除できない」ケースであり、ベンチマークが飽和状態にあると指摘します。つまり、Mythos 5.1 が実際にそうではないことを証明するまで、このモデルは Tier 2 の操作者(マニピュレーター)として扱う必要があります。
プロンプトインジェクションへの対策はほぼ完了しつつある
もしこのグラフが、敵対的な反帰納的(anti-inductive)な世界において分布外(OOD)の状況でも維持されるのであれば、これは驚くべき結果です。ただし、その保証はありません。なお、ここではプロンプトインジェクションに特化した防御策は適用されていません。


それでも、失敗率 0.1% と 0% の間には依然として大きな隔たりがあります。仮にそのリスクを千回試したとしても(決して非現実的な話ではありません)、いずれは失敗を引き起こすことになります。
5.2.2.1 と 5.2.2.2 は動的な対立を含んでいる点に注目します。現実世界は帰納法に反する性質を持っており、脅威は日々知能を高め、あなたに合わせて適応していきます。
5.2.2.1 の結果は Mythos 5 と比較すれば良好ですが、絶対的な数値で見るとまだ完璧とは言えません。一方、コンピュータ操作に関する 5.2.2.2 の評価は非常に高く、「通常の目的であれば、監督なしでコンピュータを安全に使用できる」というレベルの妥当性を示しています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み