Anthropic、科学タスク性能向上の「Claude Fable 5.1」と「Mythos 5.1」をリリース
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
Anthropic は Claude Fable 5.1 と Mythos 5.1 をリリースし、科学ベンチマークで大幅な性能向上とキャッシュ読み込みコストの劇的な削減を実現したが、ツール使用や思考ブロックに関する重大な変更が加えられた。
AI深層分析を開く2026年9月2日 06:01
AI深層分析
キーポイント
モデル性能と価格設定の刷新
Claude Fable 5.1 は Terminal-Bench-Science で 52.6% を達成し、Opus 5 や既存の Fable 5 を上回る。キャッシュ読み込みコストが 75% 削減され、典型的なワークロードで約 25% のコスト低下をもたらす。
アクセス権限の明確化
Claude Fable 5.1 は一般公開される一方、同基盤を持つ Claude Mythos 5.1 は検証済み米国組織限定の Project Glasswing に制限され、両モデル間の性能差はセーフガード層のコストによるものだと明言された。
API の破壊的変更
強制ツール使用が廃止され、思考ブロックの読み込みがモデル固有に限定されるなど、既存のルーティングやフォールバック設定に影響を与える変更が 2026 年 8 月 31 日以降のアカウントで適用される。
新機能とベータ版
メッセージごとの努力度調整やターンスコープのシステムメッセージ、思考表示の更新機能が導入され、コンテンツ証明には統計的水印が必須となる。
サイバーおよび生物学のセーフガード強化
脆弱性発見は許可されるがエクスプロイト開発は禁止され、Claude Code の介入はセッションあたり約60%削減された。生物学的セーフガードも良性リクエストに対して85%頻度が低下した。
重要な引用
Fable 5.1 scores 52.6% against 29.0% for Opus 5, 24.7% for Fable 5, and 22.4% for GPT-5.6 Sol.
Cache reads drop 75%, from $1.00 to $0.25 per million tokens
Forced tool use is gone: tool_choice set to any or tool returns a 400.
Cyber safeguards now permit vulnerability discovery but not exploit development, cutting interventions in Claude Code by roughly 60% per session.
編集コメントを表示
編集コメント
今回のリリースは、単なるバージョンアップにとどまらず、コスト構造と API の振る舞いそのものを変える転換点となる。特に「思考ブロック」の扱い変更は、複雑なシステムを構築する開発者にとって即座に対応が必要な重要なポイントである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Anthropic は、2026 年 6 月に Fable 5 シリーズをリリースしてから約 3 ヶ月後となる今回、Claude Fable 5.1 と Claude Mythos 5.1 を発表しました。両モデルは同じ基盤モデルを採用していますが、適用されるセーフティガードの層が異なります。
Fable 5.1 は一般公開され、claude-fable-5-1 という名前で利用可能です。一方、Mythos 5.1 は審査を通った組織限定で提供されます。どちらも 100 万トークンのコンテキストウィンドウと最大 128K トークンの出力に対応し、アダプティブ・シンキング(思考の適応機能)は常時オンになっています。
最も注目すべき性能指標として、Terminal-Bench-Science 0.1 で Fable 5.1 は 52.6% のスコアを記録しました。これは、Fable 5 の 24.7% や Opus 5 の 29.0% を大きく上回る結果です。
商業面での大きな変更点は、キャッシュリード(読み取り)コストが 75% 削減されたことです。従来は 100 万トークンあたり 1 ドルでしたが、現在は 0.25 ドルに引き下げられました。Anthropic によると、一般的なワークロードでは約 25% のコスト減となり、エージェント(自律型タスク実行)を多用するケースでは最大 45% の削減効果が見込めます。
一方、基本の入力・出力料金は据え置かれ、それぞれ 100 万トークンあたり 10 ドルと 50 ドルのままです。
実用化は可能でしょうか?
はい、Claude Fable 5.1 は Claude API、Amazon Bedrock、AWS の Claude Platform、Google Cloud、Microsoft Foundry で一般利用可能です。ただし、Claude Mythos 5.1 は「Project Glasswing」に参加する審査済みの米国組織に限定されており、誰でも使えるわけではありません。
ベンチマークの詳細について
エージェントによる科学調査を評価するベンチマーク「Terminal-Bench-Science 0.1」では、Fable 5.1 が 52.6% を記録しました。これに対し、Opus 5 は 29.0%、Fable 5 は 24.7%、GPT-5.6 Sol は 22.4% です。
Anthropic によると、各モデルの標準誤差は 3.5〜4.5 ポイント程度です。そのため、順位付けよりもスコアの幅(マージン)に注意して評価する必要があります。
Terminal-Bench 4.0 では、Fable 5.1 が 55.8%、Mythos 5.1 が 60.9% のスコアを記録しました。同じモデル同士でこれほど差がつくのは、セキュリティ対策によるコスト増が原因です。このように明確に理由を説明した事例は珍しく、誠実な発表と言えます。
その他の主要ベンチマークの結果も以下の通りです。CursorBench 3.2.0 は 73.4%、ツールなしの Humanity's Last Exam は 60.9%(ツールありでは 65.0%)、AutomationBench は 31.4%、OSWorld 2.0 の厳格評価は 41.7%、GDPval-AA v2 は 1853 です。
コスト削減の背景
基本の入出力料金は据え置かれています。キャッシュ読み取りのコストは大幅に低下し、百万トークンあたり 1.00 ドルから 0.25 ドルへ下がりました。これは、他の Claude モデルが 0.1 であるのに対し、Fable/Mythos では基本入力料金の 0.025 倍に相当します。一般的なワークロードではコストが約 25% 削減され、コンテキストを大量に扱うエージェント系タスクでは最大 45% の削減が見込まれます。バッチ処理の料金は、百万トークンあたりそれぞれ 5 ドルと 25 ドルです。
開発者が直面する 3 つの重要な変更点
ツール使用の強制が廃止されました:tool_choice に any を設定したり、ツール呼び出しを行ったりすると 400 エラーが発生します。代わりに、厳格なツール使用を伴う auto モードか、構造化出力を利用してください。
思考ブロックはモデル固有のものになりました:Fable 5.1 は過去のモデルの思考内容を読み取ることができますが、過去のモデルが Fable 5.1 の思考内容を参照することはできません。ルーターやフォールバックの設定で下位モデルへ切り替えると、推論機能が失われます。
以前の会話履歴への編集により、思考ブロックが無効化されます:会話中にターンごとのリマインダーを注入・削除したり、システムやツールの配列を途中から再構築したりするとエラーが発生します。この制限は、2026 年 8 月 31 日以降に作成されたアカウントに対して適用されます。回避策としては、ターン固有のシステムメッセージを使用するか、サーバー側でコンテキストを編集する方法があります。
追加機能として、メッセージごとのコスト計算、ターン限定のシステムメッセージ、そして「thinking.display: "updates"」がヘッダー設定を介してベータ版として利用可能になりました。コンテンツの出自証明は必須となり、すべての出力には統計的なテキスト透かしが埋め込まれ、ファイルには C2PA 認証情報が付与されます。
Anthropic はまた、性能低下の実態も報告しています。並列ツール呼び出しの変動が大きくなったため、エージェントループでは Fable 5 のようにバッチ処理で複数の呼び出しを行わず、ターンごとに一度だけ呼び出すケースが増えています。また、低コスト設定ではモデルの叙述が減り、記憶から直接回答する頻度が高まっています。さらに、特定の箇所のみを修正するのではなく、ファイル全体を書き換える傾向が強まっています。
セキュリティ対策と科学技術への貢献
サイバーセキュリティ対策は、脆弱性の発見自体は許可しつつ、悪用ツールの開発は禁止する方針に改められました。これにより、Claude Code でのセッションあたりの介入回数が約 60% 削減されました。生物学関連の安全フィルターも、問題のないリクエストに対して発動する頻度が 85% 減少しています。ただし、ペネトレーションテストやエクスプロイト生成、バイナリベースの脆弱性スキャンについては、引き続き Opus モデルへ誘導されます。
研究面では、Mythos 5.1 が 12 の標的に対して約 50% のヒット率でタンパク質結合体を設計しました(通常は 10〜15%)。Fable 5.1 は、解像度 2〜3km の金星の高度マップを作成。さらに、カスタム GPU カーネルにより、7 つのオープンソースゲノミクスモデルの処理速度を最大 2.5 倍に向上させました。
主なポイント
- Fable 5.1 と Mythos 5.1 はどちらも 2 層の安全フィルターを備えた同一モデルですが、一般公開されているのは Fable のみです。
- Terminal-Bench-Science 0.1 で 52.6% を達成。これは Fable 5 の 24.7% と比較して約 2 倍のスコアです。
- キャッシュ読み込みコストが 75% 削減され、100 万回あたり $0.25 に低下しました(基本料金は変更なし)。
会話履歴を編集するエージェントにとって、3 つの重要な API 変更が適用されます。
30 日間のデータ保持ポリシーが適用されます。ゼロデータ保持を希望される場合は、別途明示的な承認が必要です。
詳細な技術情報は「Technical Details」をご覧ください。また、Twitter でフォローしていただくと幸いです。さらに、15 万人以上の ML エンジニアが集まる SubReddit に参加したり、ニュースレターに登録したりすることも忘れずにお願いします。Telegram をご利用の方もいますか?今なら Telegram でも当コミュニティに参加できます。
本記事は MarkTechPost で公開された「Anthropic Releases Claude Fable 5.1 and Claude Mythos 5.1: 52.6% on Terminal-Bench-Science and 75% Cheaper Cache Reads」の翻訳です。
同じ出来事を3媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み