Meta、AIモデル「Muse Spark 1.3」を公開し知能指数で最高峰に迫る
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
Meta は新モデル Muse Spark 1.3 を発表し、特にエージェント機能と科学的能力で大幅な性能向上を達成した。
AI深層分析を開く2026年9月3日 09:36
AI深層分析
キーポイント
性能スコアの大幅向上
Muse Spark 1.3 (max) は Artificial Analysis Intelligence Index で 62 を記録し、Claude Fable 5.1 に次ぐ第 2 位となった。
エージェント作業の強化
Tau3-Bench Banking および GDPval-AA v2 などのベンチマークで前モデルを大幅に上回り、特に最大推論トークン数の増加が寄与した。
コスト効率性の優位性
同スコア帯の競合他社と比較してタスクあたりのコストが約 70% 低く、パレートフロンティアに位置している。
科学的推論能力の大幅な向上
CritPtで8ポイント、GPQA Diamondで4ポイントの上昇を示し、科学分野での性能が強化された。
特定評価におけるわずかな後退と不確実時の回答回避
AA-LCRで4ポイント低下したが、これは不確実な質問への回答を控える率が高まった結果であり、その分幻覚率が低下した。
重要な引用
Muse Spark 1.3 (max), which is in limited preview for Meta's partners, scores 62 on the Artificial Analysis Intelligence Index
The lowest cost per task for any model at 59+ on the Artificial Analysis Intelligence Index
This Tau3-Bench Banking score is #1 among all models
Muse Spark 1.3 (xhigh) is the most cost-efficient model at its intelligence level
編集コメントを表示
編集コメント
Meta は短期間のうちにモデル性能を劇的に向上させ、特にコスト対効果の面で業界標準を再定義する動きを見せている。実務での利用を検討する際は、限定的プレビュー版と一般公開版の違いに注意が必要である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
モデルページはこちら:https://artificialanalysis.ai/models/muse-spark-1-3-xhigh
Meta は 5 ヶ月間で 4 度目のモデル更新となる「Muse Spark 1.3」をリリースしました。現在、パートナー向けに限定プレビューされている「Muse Spark 1.3 (max)」は、Artificial Analysis のインテリジェンス指数で 62 を記録し、Claude Fable 5.1 と Claude Opus 5 に次ぐ第 3 位です。一方、現時点で利用可能な「Muse Spark 1.3 (xhigh)」は指数 61 で、GPT-5.6 Sol (max) や Grok 4.6 (high) と同率となっています。両バージョンのスコア向上は、主にエージェントタスクと科学技術分野での能力強化によるものです。
Muse Spark 1.3 (xhigh) は指数 61 で Artificial Analysis のインテリジェンス指数に参入しました。これは 8 ヶ月前の Muse Spark 1.2(指数 57)より 4 ポイント、7 ヶ月前の Muse Spark 1.1(指数 53)より 8 ポイントの向上です。現時点では GPT-5.6 Sol (max)、Grok 4.6 (high)、Claude Opus 5 (high) と同率ですが、Claude Fable 5.1 (max, 66)、Claude Opus 5 (max, 63)、Claude Fable 5 (max, 62) には及びません。
限定プレビュー段階にある Muse Spark 1.3 (max) は指数 62 を記録しました。このスコアは、Muse Spark 1.3 (xhigh) と比較して Tau3-Bench Banking で 52%(対 47%)、GDPval-AA v2 で 1,754 Elo(対 1,709)とそれぞれ向上した結果です。総合スコアでは Claude の Fable および Opus バリアントに次ぐ第 2 位となっています。
主なポイント:
エージェントによる知識作業タスクにおける継続的な改善
Muse Spark 1.2 の発表時、私たちは同モデルが Muse Spark 1.1 に比べて知識作業のパフォーマンスで大幅な進歩を遂げたことを指摘しました。最新バージョンの Muse Spark 1.3 (xhigh) はこの傾向を引き継ぎ、Tau3-Bench Banking で 12 ポイント(35% から 47%)もの劇的な向上を示しました。また、Terminal-Bench 2.1 でも 5 ポイント(80% から 85%)の改善を達成し、GDPval-AA v2 の Elo スコアも前作の 1615 から 1709 に引き上げられています。
さらに Muse Spark 1.3 (max) は、Tau3-Bench Banking で 52%、GDPval-AA v2 で 1,754 Elo を記録し、これらも前作を上回る結果です。特に Tau3-Bench Banking のスコアは、現在利用可能なすべてのモデルの中で最高位を誇ります。
Muse Spark 1.3 (max) は、より多くのターン数と推論トークン数を活用することでこれらの高いパフォーマンスを実現しています。具体的には、GDPval-AA v2 では 62%、Tau3-Bench Banking では 28% も推論コストが増加しており、これは Muse Spark 1.3 (xhigh) と比較した結果です。
人工知能分析指数(Artificial Analysis Intelligence Index)で 59 以上のスコアを持つモデルの中で、Muse Spark 1.3 はタスクあたりのコストが最低水準を達成しています。Meta の従来通り $1.25/$4.25(1M トークンあたり、キャッシュ入力時は$0.15)という価格設定のもと、Muse Spark 1.3 (xhigh) のタスクあたりのコストはわずか$0.55 です。
これに対し、競合の GPT-5.6 Sol (max) と Grok 4.6 (high) はそれぞれ$0.95 と$0.94 を要しており、Muse Spark 1.3 (xhigh) のコストは約 70% も安価です。この結果、Muse Spark 1.3 (xhigh) は「知能対タスクあたりのコスト」においてパレート最適のフロンティアに位置しています。
ただし、タスクあたりのコストが Muse Spark 1.2 の$0.40 よりも高くなっているのは、エージェント評価における入力トークン数が約 57% 増加したことが主な要因です。出力トークン数はわずか 8% の増加にとどまっています。なお、Muse Spark 1.3 (max) の価格設定はまだ公開されていません。
科学推論のスコアは全体的に向上し、CritPt がその牽引役となりました。Muse Spark 1.2 と比較した非自律型モデルにおける最も目覚ましいスコア上昇を示したのは CritPt で、xhigh バリアントでは大幅な +8 ポイント(18% から 26%)の改善を記録しました。また、GPQA Diamond でも +4 ポイント(90% から 94%)の上昇が見られました。一方、Humanity's Last Exam と SciCode はやや穏やかな 2〜3 ポイントの増加にとどまり、それぞれ 45% から 47%、56% から 59% となりました。
Muse Spark 1.3 (max) のスコアは xhigh バリアントとほぼ同等で、Humanity's Last Exam では 2 ポイント上昇し、GPQA Diamond では同点、CritPt では Muse Spark 1.3 (xhigh) より 1 ポイント低い結果となりました。
評価項目におけるわずかな後退はわずか 2 つに限られました。Muse Spark 1.3 の xhigh および max バリアントとも、AA-LCR において Muse Spark 1.2 から 4 ポイント低下し(83% から 79%)、AA-Omniscience (Accuracy) も xhigh で 3 ポイント、max で 1 ポイント減少しました。AA-Omniscience (Accuracy) の低下は、不確実な質問への回答を控える「Abstention」の割合が高まったことが原因です。この傾向により、Muse Spark 1.3 (xhigh) のハルシネーション(幻覚)発生率も低下しています。
その他のモデル詳細(xhigh バリアント):
- コンテキストウィンドウ:1M トークン(Muse Spark 1.2 と同様、変更なし)
- プライシング:Muse Spark 1.2 と同額。入力/出力トークン 1M あたり $1.25/$4.25。キャッシュヒット時は 1M あたり $0.15 の割引適用
- 入力モダリティ:テキスト、画像、動画
- 利用可能先:Meta 公式 API および Muse Code

Muse Spark 1.3 (xhigh) は、その知能レベルにおいて最もコスト効率に優れたモデルです。Meta の従来通り $1.25/$4.25(100 万トークンあたり)という価格設定のもと、インテリジェンス・インデックスのタスクあたりのコストはわずか$0.55 です。スコアが 59 以上となるモデルの中で、これより安価なものは存在しません。
最も近い競合は、Gemini 3.8 Flash(high, スコア 59, $0.58)、GPT-5.6 Sol(xhigh, スコア 59, $0.63)、GLM-5.3(max, スコア 60, $0.68)です。一方、スコア 61 の直接の競合モデルはコストが大幅に高く、Grok 4.6(high, $0.94)、GPT-5.6 Sol(max, $0.95)、Claude Opus 5(high, $1.23)となっています。Muse Spark 1.3 (max) は、Meta が限定版の価格設定を発表していないため、コスト比較からは除外されています。

Muse Spark 1.3 (xhigh) と Muse Spark 1.3 (max) が、Artificial Analysis のインテリジェンス・インデックスにおいて前世代の Muse Spark 1.2 から得た成果は、主にエージェント機能の評価項目に集中しています。具体的には、GDPval-AA v2 でそれぞれ +94 および +139 Elo(スコアは 1615 から 1709、そして 1754 へ)、Terminal-Bench 2.1 では +5 および +6 ポイント(正答率 80% から 85%、および 86% へ)、Tau3-Bench Banking でも +12 および +17 ポイント(正答率 35% から 47%、そして 52% へ)と大幅な向上が見られました。
一方で、わずかな性能低下も確認されています。両モデルとも AA-LCR で 4 ポイントの低下(83% から 79%)、AA-Omniscience(精度)では xhigh が 3 ポイント(45% から 42%)、max が 1 ポイント(45% から 44%)減少しました。

Muse Spark 1.3 (max) は、新設された Tau3-Bench Banking の評価で 52% を記録し、現在の第 1 位となりました。一方、Muse Spark 1.3 (xhigh) は 47% で、Claude Fable 5.1 (max, 47%) や GLM-5.3-Flash (47%) と同点ですが、同じシリーズの上位モデルである Qwen3.8 Max (51%)、Grok 4.6 (high, 51%)、GLM-5.3 (max, 50%) には及びません。
先月の Muse Spark 1.2 が記録した 35% から今回の評価における大幅な向上は、Muse Spark 1.3 の各バリアントが示す Artificial Analysis Intelligence Index のスコア改善において、最も大きな要因となっています。

Artificial Analysis Intelligence Index における個別の評価項目の詳細な内訳は以下の通りです。

Muse Spark 1.3 の詳細やベンチマーク結果については、Artificial Analysis をご覧ください。
https://artificialanalysis.ai/models/muse-spark-1-3 および https://artificialanalysis.ai/models/muse-spark-1-3-xhigh
同じ出来事を2媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み