Claude Fable 5.1 が人工知能指数で最高位に
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Artificial Analysis
Anthropic が発表した Claude Fable 5.1 は人工知能分析指数で最高スコアを記録したが、キャッシュ価格の大幅値下げにもかかわらずタスクあたりのコストは前モデルより 20% 上昇している。
AI深層分析を開く2026年9月2日 08:38
AI深層分析
キーポイント
性能評価での首位獲得
Claude Fable 5.1 は Artificial Analysis の指数で 66 と最高スコアを記録し、Claude Opus 5 や GPT-5.6 Sol を上回った。
コスト構造の複雑化
キャッシュ読み込み価格が 75% 削減されたものの、出力トークン数の増加によりタスクあたりの総コストは前モデルより 20% 高騰した。
エージェント作業での優位性
GDPval-AA や AA-Briefcase といったエージェント評価において、Claude Fable 5 は大幅なスコア向上を達成し、Opus 5 と同等以上の性能を示した。
パレート最適性の維持
知能指数と出力トークン数のトレードオフにおいて、GPT-5.6 Sol よりも高いスコアを持つすべてのモデルを、Fable 5.1 の各種設定が上回るか同等の性能を発揮する。
キャッシュヒット価格の大幅引き下げ
キャッシュヒット料金が100万トークンあたり$1から$0.25に75%削減され、エージェントワークロードのコストが大幅に低下する。
重要な引用
At max effort it scores 66 on the Artificial Analysis Intelligence Index, the highest score we have measured
Fable 5.1 (max) costs $3.76 per Intelligence Index task, 20% more than Fable 5 (max), because it uses ~1.7x the output tokens.
every model variant scoring higher than GPT-5.6 Sol (medium) on the Intelligence Index is matched or beaten by a Fable 5.1 effort level
"cache hits have been reduced to $0.25 per million tokens, a 75% relative reduction that will materially reduce agentic workload costs"
編集コメントを表示
編集コメント
性能が向上する一方でコストが増加するという、AI モデル開発における典型的なトレードオフを浮き彫りにしている。キャッシュ価格の引き下げは長期的には有益だが、短期的なタスク単価への影響は限定的であることが示された。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
クロード・フェイブル 5.1 が人工知能分析指数で首位に立つが、キャッシュ読み込みコストを 75% 削減したにもかかわらず、タスクあたりの費用はフェイブル 5 よりも 20% 高くなる
私たちは Anthropic と協力し、Claude Fable 5.1 のリリース前評価を行いました。最大性能でのスコアは人工知能分析指数で 66 を記録し、これは私たちが測定した中で最高値です。この結果は Claude Opus 5(最大 63)、Claude Fable 5(最大 62)、GPT-5.6 Sol(最大 61)、そして Grok 4.6(高設定で 61)を上回っています。
今回の評価では、Anthropic の「デフォルト」サーバーサイドフォールバック機能を利用しました。これは安全性のフラグが立ったリクエストを Claude Opus 4.8 または Claude Opus 5 に振り分ける仕組みです。このフォールバック機構は、人工知能分析指数全体で出力トークンの約 4% を担当していました。
主なポイント:
➤ ベンチマーク全般での改善を伴う最先端の知能: フェイブル 5.1 は、人工知能分析指数においてフェイブル 5 よりも 4 ポイント向上しました。HLE では 59.1% のスコアを記録し、Claude Fable 5 が持っていたこれまでの最高値 55.5% を上回りました。また、Terminal-Bench v2.1(91.4%)と SciCode(62.0%)では、私たちが観測した中で最も高いスコアを僅差で記録しました。さらに 𝜏³-Banking では、フェイブル 5 よりも 9 ポイントの向上を果たしています。
➤ キャッシュ読み込み料金が75%値下げされたものの、タスクあたりのコストは依然として上昇: Anthropic は、100 万トークンあたりキャッシュ入力トークンの読み込み価格を 1 ドルから 0.25 ドルに引き下げました。一方、標準的な価格は 100 万トークンあたり入力・出力ともにそれぞれ 10 ドルと 50 ドルのまま変更されていません。Fable 5.1 (max) の場合、Intelligence Index のタスクあたりのコストは 3.76 ドルで、Fable 5 (max) よりも 20% 高くなっています。これは出力トークン数が約 1.7 倍に増えたことが原因です。キャッシュ料金の値下げにより、タスクあたり約 1.40 ドルの節約が可能になりましたが、これは主に入力トークンの大半がキャッシュ読み込みとなるエージェント評価の分野で集中して発生します。xhigh エフォート設定では Fable 5.1 はスコア 65 を記録し、コストはタスクあたり 2.72 ドルとなり、max モデルより 1.04 ドル安くなりますが、それでも Claude Opus 5 (max, スコア 63) の 2.34 ドルよりは高い水準です。
➤ Claude Fable 5.1 は「知能指数対タスクあたりの出力トーク数」のパレートフロンティアの上位を維持: Intelligence Index で GPT-5.6 Sol (medium) よりも高いスコアを出すすべてのモデル変種について、Fable 5.1 のいずれかのエフォート設定が、知能指数とトークン使用量の両方で同等かそれ以上の性能を発揮します。
➤ エージェント作業タスクで最高スコアを記録したが、Opus 5 と実質的に同水準: Fable 5.1 は、私たちが測定したエージェント知識業務評価である GDPval-AA v2 (Elo 1,853、Fable 5 より +130) および AA-Briefcase (Elo 1,694、Fable 5 より +122) で最高スコアを達成しました。Claude Opus 5 と比較すると、GDPval-AA v2 のリード値は信頼区間内に収まり、AA-Briefcase (1,685) は実質的に同点です。Fable 5.1 は分析品質と評価基準の正確性で上回っていますが、プレゼンテーション能力では劣っています。
その他のモデル詳細:
コンテキストウィンドウは 100 万トークンに拡張され、Anthropic の他の最近のリリースと同様に、画像とテキストの入力をサポートしています。
価格設定では、Fable 5.1 は Fable 5 と同じく、入力・出力・キャッシュ書き込みに対してそれぞれ百万トークンあたり 10 ドル/50 ドル/12.5 ドルを維持していますが、キャッシュヒット料金は百万トークンあたり 0.25 ドルに引き下げられました。これは相対的に 75% の削減となり、エージェントワークロードのコストを実質的に低下させる効果があります。

Claude Fable 5.1 (max) の Artificial Analysis Intelligence Index でのコストは 3.76 ドルで、Fable 5 (max) の 3.14 ドルより 20% 高く、Claude Opus 5 (max) の 2.34 ドルの 1.6 倍です。これは Fable 5 より約 1.7 倍の出力トークンを使用していることが主な要因です。Anthropic がキャッシュ読み込み料金を百万トークンあたり 1 ドルから 0.25 ドルに引き下げたことで、タスクあたりのコストは約 1.40 ドル削減されました。もしこの値下げがなければ、Fable 5.1 のコストは約 5.16 ドルになっていたはずです。
高負荷設定(xhigh effort)では Fable 5.1 はスコア 65 を記録し、タスクあたり 2.72 ドルで、最大負荷設定より 1.04 ドル安くなります。

Claude Fable 5.1 の 5 つの負荷設定は、出力トークン使用量が低負荷時の 1310 万トークンから最大負荷時の 1.437 億トークンまで約 11 倍に広がり、Artificial Analysis Intelligence Index のスコアも 58 から 66 の範囲にあります。どの負荷設定においても Fable 5.1 は「知能対出力トーク数」のフロンティア上に位置していますが、その下限は GPT-5.6 シリーズよりも高い水準です。具体的には、GPT-5.6 Sol(ミディアム)が使用するわずかに少ないトークン数は 1200 万で、Fable 5.1 の低負荷設定の 1310 万トークンと比較されています。
Claude Fable 5.1 (max) は、GDPval-AA v2 ベンチマークで 1,853 Elo を記録し、Claude Opus 5 (max) の 1,824 を上回っています。ただし両者の信頼区間は重なっており、明確な優劣は断定できません。
AA-Briefcase では、Fable 5.1 が 1,694、Opus 5 が 1,685 とほぼ同点ですが、内訳には差が見られます。分析の質では Fable 5.1 が 2,025 で Opus 5 の 1,980 を上回っていますが、プレゼンテーションの質では Fable 5.1 が 1,495 と Opus 5 の 1,572 に劣っています。これらのベンチマークは、オープンソースのリファレンスエージェント・ハネス「Stirrup」を用いて、モデルが正確かつ適切に提示された専門的な成果物を生成できるかを検証するものです。

Claude Fable 5.1 (max) は、AA-Omniscience の質問に対して Claude Opus 5 の 87.8% を上回る 93.4% に挑戦し、67.2% というこれまでで最高となる精度を記録しました。これは Claude Fable 5 の 65.4% よりも高い数値です。
ただし、挑戦率が高いため幻覚(ハルシネーション)の発生も増えています。正解しなかった質問のうち、Fable 5.1 は 72.6% で回答を試みており、Claude Fable 5 の 63.6% よりも高い割合です。この二つの効果はお互いに相殺し合い、結果として AA-Omniscience インデックスのスコアは Claude Fable 5 と同等となりました。

Claude Fable 5.1 の、あらゆる推論試行における Artificial Analysis Intelligence Index の各評価項目の詳細な内訳は以下の通りです。


Claude Fable 5.1 の詳細やベンチマークについては、Artificial Analysis をご覧ください:https://artificialanalysis.ai/models/claude-fable-5-1
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み