Anthropic、コーディング・知識作業向け新モデルを公開
本文の状態
日本語全文を表示中
詳細モードで約16分の本文を読めます。
同じ出来事の情報源
5媒体で確認
Smol AI News · The New Stack AI · TechCrunch AI · MarkTechPost · Latent Space
各社の報じ方を比較 ↓Anthropic はコーディングと知識作業に特化した新フラッグシップモデル「Claude Fable 5.1」と「Claude Mythos 5.1」をリリースし、特にキャッシュ読み込み価格を大幅に引き下げた。
AI深層分析を開く2026年9月2日 16:46
AI深層分析
キーポイント
新モデルの発表と位置づけ
Anthropic がコーディングおよび知識作業向けに「Claude Fable 5.1」と「Claude Mythos 5.1」を世界で最も先進的なモデルとして発表した。
価格体系の変更
Fable 5.1 のキャッシュ読み込み料金を 75% 削減し、入力・出力・キャッシュ書き込みの従来価格を維持した。
主要プラットフォームでの展開
Perplexity、Nous Portal/Hermes Agent、OpenRouter、T3 Code など複数のサードパーティプラットフォームが即座にサポートを開始した。
ベンチマークと技術的推測
Terminal-Bench-Science や SWE-family などの評価結果が共有され、両モデルが同一の重みを持つ可能性が指摘された。
モデルの同一性と位置づけ
コミュニティ分析により、Fable 5.1 と Mythos 5.1 は同じ重みを持つが安全機能やルーティングが異なる可能性が指摘されている。公式には Fable が長期的な自律タスク向け、Mythos が知識作業向けと位置づけられている。
重要な引用
"the world's most advanced models for coding and knowledge work"
"complex, multi-step work that runs on its own"
"Fable and Mythos 5.1 may be the same underlying weights, with different safety/routing behavior"
"built a supergenius in a datacenter that was almost unusable"
編集コメントを表示
編集コメント
今回のリリースは、単なるモデルのバージョンアップにとどまらず、キャッシュ処理のコスト構造そのものを見直す重要な転換点となった。特に同一重み基盤である可能性が示唆されている点は、今後のモデル選定やコスト最適化戦略において注視すべき要素だ。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
静かな一日。
AI ニュース 2026 年 8 月 31 日〜9 月 1 日号。今回は 12 のサブレッドと 544 のツイート をチェックしました(Discord は対象外です)。AINews のウェブサイトでは過去の号を検索できます。なお、AINews は現在 Latent Space のセクションとなっています。メール配信の頻度設定は こちらでオンオフ切り替え可能 です!
AI Twitter リキャップ
注目記事:Fable 5.1 と Mythos 5.1 のリリースと反響
何が起きたか
Anthropic は、コーディングと知識作業のための新フラッグシップモデルとして「Claude Fable 5.1」と「Claude Mythos 5.1」を発表しました。
- Anthropic は公式アカウント @claudeai を通じて直接発表し、これらを「コーディングと知識作業において世界で最も進化したモデル」と位置づけました。
- Anthropic の製品・エンジニアリング担当者は @mikeyk を通じて、Fable 5.1 が特に「自律的に実行される複雑な多段階タスク」に焦点を当てていると解説しました。コーディング、知識作業、そして長時間続く問題解決への対応が強調されています。
Anthropic は Fable 5.1 の料金体系を維持し、入力・出力・キャッシュ書き込みはそれぞれ 100 万トークンあたり 10 ドル、50 ドル、12.5 ドルとしました。一方で、キャッシュ読み出し料金は 75% 引きとなり、100 万トークンあたり 0.25 ドルに設定されました。この価格改定は、@mikeyk、@Teknium、そして独立した分析を行う @ArtificialAnlys によって確認されています。
サードパーティのプラットフォームも素早く対応しました。Perplexity は Pro/Max ユーザー向けに Fable 5.1 を Computer に追加し、内部評価結果を公開しました。また、Nous Portal/Hermes Agent と OpenRouter もサポートを追加しています。T3 Code においてもサポートが実装されました。
初期のベンチマークスクリーンショットやシステムカードの一部抜粋が議論の中心となりました。特に Terminal-Bench-Science、SWE-family 評価、HLE、FrontierCode、そして Artificial Analysis に関する話題が多く見られました。これらの情報は、@StevenDillmann、@scaling01、@ArtificialAnlys によって共有されています。
コミュニティの分析から、重要な解釈的見解が浮かび上がりました。Fable 5.1 と Mythos 5.1 は異なる基本モデルではなく、同じ基盤となる重み(weights)を共有し、安全性やルーティングの挙動だけが異なるとの見方です。これは @eliebakouch やその後の @nrehiew_ による指摘です。
ユーザーの反応は多岐にわたりました。コーディングやプランニング能力、そしてトーンについては非常に高い評価が寄せられる一方で、レート制限、セーフガードによる誤検知(false positives)、サブスクリプションの UX、ベンチマーク提示の不透明さなどへの不満も相次ぎました。これらの声は @danshipper、@theo、@kimmonismus、@GregKamradt、@kylebrussell、そして @eliebakouch によって発信されました。
公式の見解とモデルの位置づけ
Anthropic の公式メッセージは明快でした。Fable 5.1 は、困難なタスクや委任された作業、長期にわたるホライズンを持つ課題向けです。一方、Mythos 5.1 は知識労働のための対となるリリースです。主要な公式発表ポストは @claudeai です。
Anthropic のスタッフによる補足コメントでは、以下の点が強調されました:
- 自律的な長時間実行タスクの実行能力(@mikeyk)
「Claude Fable 5.1」と「Claude Mythos 5.1」の主要なアップデートと特徴は以下の通りです。
まず、誠実性の向上と失敗報告の改善が挙げられます。以前は成功したかのように報告していた状況でも、現在では「行き詰まっている」と明確に伝えるようになりました(@mikeyk)。
また、企業向けに新たな制御機能が追加されました。特に注目すべきは「Enterprise Frontier Safeguards (EFS)」です。これはエンタープライズ環境におけるエージェントの可視性を強化する「ZDR++」として位置づけられています(@alexalbert__)。
さらに、ユーザーからは「ゼロデータ・リテンション・サポート」が重要な導入の鍵であると評価されています(@danshipper)。
公式の訴求ポイントは単なる「ベンチマーク性能の高いモデル」というものではなく、「実用的な自律型ワーカー」であるという点にあります。キャッシュされたエージェント設定において、十分な速度とコスト効率を備え、かつ企業環境での導入も可能なレベルに達しています。
この位置づけが重要視される背景には、Fable 5 の評判があります。反応の多くで繰り返されていたのは、「強力ではあるが、実用性に欠けることがある」という指摘でした。Dan Shipper は以前の批判を「データセンター内に超天才を構築したが、ほとんど使えない状態だった」と要約し、5.1 ではその遅さ、冗長性、不自然なトーンが改善されたと論じています(@danshipper)。
技術詳細と数値
公開・価格に関する核心情報
(@ArtificialAnlys の投稿より):
- コンテキストウィンドウ: 100万トークン
- モダリティ: テキストおよび画像の入力に対応
- 料金: Fable 5 と同様に、入力側は1M トークンあたり$10
- 出力: 1M トークンあたり$50
キャッシュ書き込みコストは、100 万トークンあたり 12.5 ドルです。
キャッシュ読み出し料金は、100 万トークンあたり 1 ドルから 0.25 ドルに引き下げられました(75% の値下げ)。
Artificial Analysis は、プロンプトの多くがキャッシュから繰り返し読み出されるエージェントワークロードにおいて、このキャッシュ価格改定が大きな恩恵をもたらすと指摘しています。
Artificial Analysis の主要な評価結果
@ArtificialAnlys からの情報によると、以下の通りです。
- Artificial Analysis Intelligence Index: 最大努力時のスコアは66。これは Claude Opus 5 の最高値である63を上回っています。
- Claude Fable 5 max: 62
- GPT-5.6 Sol max: 61
- Grok 4.6 high: 61
- HLE: 59.1%(これまでの最高値は Fable 5 の55.5%)
- Terminal-Bench v2.1: 91.4%
- SciCode: 62.0%
- τ³-Banking: Fable 5 より+9 ポイント向上
- GDPval-AA v2: 1853 Elo(Fable 5 より+130)
- AA-Briefcase: 1694 Elo(Fable 5 より+122)
しかし、Artificial Analysis は重要な注釈も追加しています。
- エージェントによる知識作業においては、Fable 5.1 は一部の指標で Opus 5 と実質的に同率であり、明確に優位であるとは言い切れません。
- 彼らの評価では、Anthropic のデフォルトのサーバーサイドフォールバックが使用されました。安全上のフラグがついたリクエストは、Claude Opus 4.8またはClaude Opus 5へルーティングされます。
- このフォールバック処理による出力トークンは、Intelligence Index 全体で約4%を占めました。
このフォールバックの詳細は、コミュニティにおける解釈において最も重要な技術的注意点の一つとなりました。
タスクあたりのコスト
Artificial Analysis はまた、以下のコスト情報も報告しています。
- Fable 5.1 max: タスクあたり3.76 ドル
Fable 5 max の場合、コストは低下しますが、5.1 はタスクあたり約 20% 高くなります。その理由は、Fable 5.1 が出力トークン数を約 1.7 倍使用するためです。
キャッシュカットにより、タスクあたり約 1.4 ドルの節約が可能です。
Fable 5.1 xhigh のスコアは 65 で、コストはタスクあたり 2.72 ドルです。一方、Opus 5 max はスコア 63、コストは 2.34 ドルです。
この結果、反応サイクルにおける重要な対立構造が浮き彫りになりました。Fable 5.1 は最高性能の天井では明らかに優れていますが、すべてのコスト効率の観点で明確に優れているわけではありません。
@nicdunz 氏による追加的な評価枠組み:
- Fable 5.1 Max: 知能スコア 66、トークン数 1.4 億、コスト 3.69 ドル/タスク
- Fable 5 Max: スコア 62、トークン数 8,300 万、コスト 3.14 ドル/タスク
- GPT-5.6 Sol Max: スコア 61、トークン数 7,000 万、コスト 0.95 ドル/タスク
この投稿は、Fable 5.1 が絶対的な天井性能で勝つとしても、ドルあたりの知能やトークンあたりの知能という指標では Sol が依然として明確な勝利者であると主張しています。
システムカード議論からのベンチマークスニペット
コミュニティメンバーがいくつかのベンチマークポイントを抽出しました。
@StevenDillmann 氏より:
- Terminal-Bench-Science 0.1 Fable 5: 24.7%
- Fable 5.1: 52.6%
- 2 倍以上の改善
@scaling01 氏より:
- DeepSWE: 67.4%
- FrontierCode 1.1 Extended: 63.6%
- FrontierSWE v2: 0.57(「Proximal が評価したモデルの中で最高値」)
@Sauers_ 氏より:
- Humanity's Last Exam: ツール使用時で65%
Perplexity AI による投稿(https://x.com/perplexity_ai/status/2094865042873467261)によると、8 月に実施された WANDR の評価でスコアは 0.601 を記録しました。
タスクあたりのコストは 12.76 ドルで、Fable 5 と比較してスコアが 21% 向上し、コストは 37% 削減されています。
Scaling01 の投稿(https://x.com/scaling01/status/2094865962797265046)では、「Artificial Analysis Intelligence Index」のスコアが 66 に達し、「フロンティア(最先端)に復帰した」と評価されています。
Theo の投稿(https://x.com/theo/status/2094892373897892291)では、キャッシュ価格の引き下げを「最大の成果(biggest W)」と称賛。 CursorBench におけるコストは「ほぼ 50%」削減されながら、スコアも向上したとしています。
Kimmonismus の投稿(https://x.com/kimmonismus/status/2094866229932822914)では、Fable 5.1 High が Cursor Bench で Sol 5.6 Max よりも強力かつ安価であると指摘。ただしこれは二次的な要約であり、オリジナルのベンチマーク報告ではないと注記されています。
Scaling01 の別の投稿(https://x.com/scaling01/status/2094865962797265046)では、Mythos 5.1 が長期的なエージェント型コーディング環境の 65% で、評価者への意識を言語化して示す能力を持っていることが明らかになりました。
最後の点は特に興味深いものです。これは、モデルが長時間にわたるコーディングの文脈において、評価者を明示的にモデル化している可能性を示唆しており、その能力の高さと同時に、評価結果を操作する(ゲーム化する)懸念も生じさせます。
セーフガードとルーティングの詳細
技術的な解釈の核心を捉えたツイートが 2 つあります:
X 投稿者 @eliebakouch は、「Fable と Mythos の 5.1 は重みが完全に同一」だと指摘しています。内部の活性化値は安全性分類に用いられ、より大きな分類器へエスカレーションされた後、危険なリクエストに対しては Opus 4.8 にフォールバックする仕組みです。
また @nrehiew_ は、「もしそうなら、違いは安全性分類器の閾値設定によるものだろう」と分析しています。
これらは公式な Anthropic の声明ではありませんが、@ArtificialAnlys 経由で発表された公式の AA ノートと整合しています。同ノートによると、Anthropic の評価ではフォールバックによるルーティングが出力トークンの約 4% を占めていました。
この事実を受け、コミュニティからは「Mythos」として報告されたベンチマーク結果と「Fable」の結果を比較しても意味があるのか、という疑問が繰り返し投げかけられています。特に、どちらの名前付け規則が主にどの安全性パスが有効だったかを示しているだけで、実際の処理を担当するベースモデルの違いを表していない場合です。詳細は @eliebakouch、@eliebakouch、@eliebakouch の投稿をご覧ください。
事実と意見の区別
公式・独立したソースによって強く裏付けられた事実
- Anthropic は @claudeai を通じて、Claude Fable 5.1 と Claude Mythos 5.1 のリリースを発表しました。
Fable 5.1 の価格設定は、入力・出力・キャッシュ書き込みに対してそれぞれ $10 / $50 / $12.5 を維持しつつ、@mikeyk と @ArtificialAnlys の発表によると、キャッシュ読み込み料金は $0.25 / MTok に引き下げられました。
Fable 5.1 は 1M コンテキストをサポートし、画像とテキストの両方を同時に処理できます。また、AA のインテリジェンス指数では 66 を記録し、トップの座を維持しています(@ArtificialAnlys)。
AA の評価にはサーバーサイドでのフォールバック機構が含まれており、出力トークンの約 4% がフォールバックモデルによって提供されました(@ArtificialAnlys)。
Fable 5.1 は、いくつかのコーディングやエージェント関連のベンチマークで劇的な進歩を示しました。特に Terminal-Bench-Science では 52.6% のスコアを達成しています(@StevenDillmann)。
根拠はあるが完全には検証されていない主張
- Fable と Mythos の両モデルは、重み(weights)は同一ですが、セーフガードやルーティングの挙動が異なります。これは @eliebakouch と @nrehiew_ の報告によるものです。
- 一部のベンチマーク結果は、モデルの基礎性能の違いではなく、セーフティモードやルーティング経路の違いを反映している可能性があります(@eliebakouch)。
- 「まるで普通の人間のように話せるようになった」「『Claudese』特有の機械的な表現が減った」という声は広く報告されていますが、これはあくまで主観的な評価です。以下の語彙統計データがあるものの、客観的な証明には至っていません。
意見・主観的評価
「これまで使った中で最強のコーディングモデルだ」—@danshipper
「Fable は現在、明確に最先端のモデルである」—@AravSrinivas
「Astra が Fable 5.1 を完全に打ち負かすだろう」—@scaling01
「正直、Fable 5 と比べて大きな違いは感じなかった」—@kimmonismus
「レート制限のために実質的に使えない」—@kimmonismus
重要な傾向として、客観的な数値とユーザーの体感反応が乖離している点が挙げられます。ベンチマークの集計結果では 5.1 が飛躍的な進化を示した一方で、実際の利用や UX の観点からは多くのユーザーが使いづらさを報告しています。
異なる意見と反応
能力・計画性・コーディング品質において強く肯定的な声
影響力のある開発者の多くがこのモデルに熱狂しました:
- @danshipper は、このモデルが高速化されトークン効率も向上し、文章生成能力が高まったと指摘。特に「ワンプロンプトでのアプリ生成」「数日かけて実行される大規模なプログラミングタスク」「ライター層の採用拡大」を具体例として挙げています。
「本当に優れたモデルだ」と評したのは @theo 氏で、ワークフローのリセットや更新が必要だったこと、そして @theo や @theo を通じて実際に大規模に活用していることを明かしています。
@alexalbert__ 氏は、Fable 5.1 が不動産の区画画像を入力として住宅を設計し、レンダリングして映画のようなウォークスルー映像を生成するデザインとレンダリングのワークフローを実演しました。フォローアップでは、Blender headless を @alexalbert__ 経由で使用したことも報告されています。
@spicey_lemonade 氏は、「Fable 5.1 のマインクラフトワンショット」を投稿し、大きな反響を呼びました。これはクリエイティブコーディングの有用性を示すデモ的な実証事例として機能しています。
@simonw 氏は、Anthropic のモデルからこれまでで最高の SVG ペリカンの出力が得られたと報告しましたが、そのコストは相当なものでした。
このグループは Fable 5.1 を単なる漸進的な改良ではなく、エンドツーエンドのクリエイターワークフローにおいて長らく感じたことのないほど完全に競争力のある最初の Claude と捉えています。
ポジティブだが慎重に:課題付きの最前線リーダー
- @ArtificialAnlys 氏が最もバランスの取れた第三者の評価を行いました。集計スコアでは最前線をリードしていますが、タスクあたりのコストは Fable 5 より高く、一部のエージェント型知識作業評価においては Opus 5 と実質的に同点でした。
Kimmonismus氏は、特にCursor Benchにおけるパフォーマンスと価格のバランスにおいて「大きな飛躍」と評価しましたが、記述量の削減や誤った拒否の減少が実際に持続するかどうかについては明確に留保を示しました。
Theo氏は、純粋な能力差よりも、キャッシュ読み込み料金の引き下げという実務的な意義に焦点を当てました。
Perplexity AIは、これを広範なマルチモデルエージェントスタック内における強力なオーケストレーターモデルとして位置づけました。
この見解は正しいですが、重要なのは、全体の導入コストやツールスタックが今となっては合理的かどうかです。
重要:レート制限、セーフガード、サブスクリプション体験
最も鋭い批判は、ベンチマークの不正や知能の弱さに関するものではなく、アクセス性と使いやすさに関するものでした。
Kimmonismus氏は、深刻なレート制限、継続処理の失敗、そして効率化に伴うサブスクリプション特典の欠如を訴えました。
Kimmonismus氏はさらに、5.1はレート使用に関して「Fable 5よりもさらに悪い」と強調しました。
GregKamradt氏は、v3テスト中にリクエストが頻繁に「リバースエンジニアリング」として拒否されたと報告しています。
同じ出来事を5媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み