Muse Spark 1.2、SpaceXAI と同点で AI ベンチマーク 3 位
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Artificial Analysis
Meta は Muse Spark 1.2 を発表し、エージェント性能が大幅に向上したもののコストが増加し、知能指数で主要競合と並ぶ位置となった。
AI深層分析を開く2026年8月6日 08:21
AI深層分析
キーポイント
エージェント性能の劇的改善
Muse Spark 1.2 は知識作業におけるエージェント能力を強化し、GDPval-AA v2 のスコアが前バージョンから大幅に上昇して上位モデル群に並んだ。
コスト効率と利用量のトレードオフ
知能指数レベルではコスト効率が優れているものの、タスクあたりのコストは増加しており、これはトークン使用量の増大が主な要因である。
不確実時の回答拒否の増加
ハルシネーション率を低下させるため、同社は不確実な質問への回答拒否(アブステイン)率を引き上げ、信頼性の高いモデルへと進化させた。
業界内での相対的評価
この発表により Meta は SpaceXAI と並んで第 3 位となり、Claude や GPT の最新モデルに次ぐ位置付けとなった。
エージェント型知識作業能力の大幅な向上
Muse Spark 1.2 は GDPval-AA v2 Elo が 260 ポイント上昇し、Claude Opus 4.8 を上回る第5位を記録した。ターミナル利用やツール使用に関するベンチマークでもスコアが改善され、エージェント能力の格差が縮小された。
重要な引用
Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index.
Its GDPval-AA v2 Elo rose 260 points to 1631, #5 among all models we have benchmarked.
Muse Spark 1.2 costs $0.40 per Intelligence Index task at Meta's unchanged $1.25/$4.25 per 1M token pricing.
Its GDPval-AA v2 Elo rose 260 points to 1631, #5 among all models we have benchmarked and ahead of Claude Opus 4.8 (max, 1588).
編集コメントを表示
編集コメント
Meta は短期間のうちにモデルを大幅にアップデートしており、その進化のスピードは業界全体を牽引している。コスト効率と性能向上のバランスが明確になった今、実務での採用基準を見直す時期と言えるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Muse Spark 1.2: タスクあたりのコストは上がるが、エージェント性能は向上
Meta の「Muse Spark 1.2」は、Artificial Analysis Intelligence Index で 54 点を記録しました。これは 4 ヶ月間で 3 回目となるリリースで、以前のバージョンに比べてエージェントによる知識作業の能力を大幅に強化しています。この結果、米国の主要ラボの中で SpaceXAI と並び第 3 位につけました。
Muse Spark 1.2 (xhigh) のスコアは 54 で、直前の Muse Spark 1.1 (51) より 3 ポイント、昨年 4 月にリリースされた Muse Spark 1.0 (43) よりも 11 ポイント向上しています。現時点では GPT-5.5 (xhigh, 55) や Grok 4.5 (high, 54) とほぼ同点で競り合っており、現在の最先端モデルである Claude Opus 5 (max, 61)、Claude Fable 5 (max w/ fallback, 60)、GPT-5.6 Sol (max, 59)、そして Kimi K3 (max, 57) にわずかに及ばない状況です。ベンチマーク実施のため、Meta は一般公開前にアクセス権を当メディアに提供しました。
主なポイント:
Muse Spark 1.2 は、エージェント型ナレッジワークの最前線にさらに近づきました。Muse Spark 1.1 の発表時、私たちは「エージェント型ナレッジワーク」が最大の課題であると指摘していました。Muse Spark 1.2 の性能向上により、このギャップを埋めることができました。GDPval-AA v2 の Elo スコアは 260 ポイント上昇し 1631 となり、私たちがベンチマークしたモデルの中で 5 位にランクインしました。これは Claude Opus 4.8(最大値 1588)を上回る結果です。
GDPval-AA v2 は、プレゼンテーションの作成や分析といった現実的なナレッジワークタスクを評価し、エージェントループ内でシェルアクセスと Web ブラウジング機能を備えた参照ハーンである Stirrup を通じてモデルのパフォーマンスを測定する、当社の主要指標です。また、エージェントによるコーディングやターミナル操作を測る Terminal-Bench v2.1 では 2 ポイント(78% から 80%)向上し、エージェントのツール使用能力を評価する τ³-Banking でも 2 ポイント(25% から 27%)上昇しました。
Muse Spark 1.2 は、その知能レベルにおいて最もコスト効率に優れたモデルの一つです。Meta の従来通り $1.25/$4.25 per 1M トークンの価格設定のもと、インテリジェンスインデックスタスクあたりのコストは$0.40 です。同クラスでこれより安いのは Grok 4.5(高品質版、$0.37)と GPT-5.6 Sol(ミディアム版、$0.39)のみです。GPT-5.6 Terra(最大値、$0.51)、Kimi K3(最大値、$0.86)、GPT-5.5(X 高品質版、$1.18)はすべてタスクあたりのコストが高くなります。
Muse Spark 1.1 から Muse Spark 1.2 へのコスト増(タスクあたり$0.29 から$0.40)の主な要因は、インテリジェンスインデックスタスクあたりのトークン使用量の増加です。特に GDPval-AA v2 で顕著で、入力トークンは約 53%、出力トークンは約 36% 増加しています。
➤ AA-Omniscience の拒否率の上昇:幻覚率が 10 ポイント低下(38% から 28%)し、回答試行率が 82% から 67% に下がったことで、スコアは 18 から 22 に上昇しました。AA-Omniscience は知識の信頼性と幻覚を測定する指標で、正解には加点し、幻覚には減点しますが、回答拒否に対してはペナルティを与えません。Muse Spark 1.2 では、不確実な質問への回答拒否(アブステイン)が頻繁に起こるようになった結果、幻覚率が低下した一方で、精度もわずかに低下しました(41% から 38%)。
➤ 科学的推論の結果は概ね横ばい:研究レベルの物理学的推論を問う CritPt は 3 ポイント上昇し(15% から 18%)、一方 SciCode は 2 ポイント低下(58% から 56%)、Humanity's Last Exam も 1 ポイント低下(45% から 44%)しました。
➤ モデルの詳細:Muse Spark 1.2 は、Muse Spark 1.1 と同じ 1M トークンのコンテキストウィンドウと価格体系を維持しています。入力・出力トークン 100 万あたり $1.25/$4.25 で、キャッシュヒット時は 100 万あたり $0.15 の割引が適用されます。また、ローンチ時には Meta の公式 API でも利用可能です。

エージェント機能と知能評価
Muse Spark 1.1 と比較して Artificial Analysis Intelligence Index で 3 ポイント上昇した点は、主にエージェント機能の評価に集中しています。具体的には、GDPval-AA v2 が +260 Elo(1371 から 1631)、Terminal-Bench v2.1 が +2 ポイント(78% から 80%)、τ³-Banking が +2 ポイント(25% から 27%)と改善しました。一方、SciCode は -2 ポイント、Humanity's Last Exam は -1 ポイントとわずかに低下しています。

GDPval-AA v2 リーダーボード
Muse Spark 1.2 は、GDPval-AA v2 でエロ 1631 を記録し、5 位にランクインしました。上位には Claude Opus 5(最大値 1852)、GPT-5.6 Sol(最大値 1730)、Kimi K3(最大値 1685)が並び、下位には Claude Opus 4.8(最大値 1588)が続きます。先月リリースされた Muse Spark 1.1 のスコアは 1371 でした。

知能指数とタスクあたりのコストの関係
Muse Spark 1.2 は、知能指数とタスクあたりのコストの間に存在するパレート最適領域(Pareto frontier)に位置しています。タスクあたりのコストは 0.40 ドルです。

AA-Omniscience Index
Muse Spark 1.2 は、Meta の AA-Omniscience パターンを継続しています。スコアは前回から 18 から 22 に上昇しました。これは、2 回連続で回答拒否(abstention)を行ったことが要因です。一方、ハルシネーション(幻覚)発生率は 10 ポイント低下し、38% から 28% になりました。これは試行率が 67% に減少した結果ですが、精度は 41% から 38% にわずかに低下しています。

知能評価の詳細
Artificial Analysis の知能指数における各個別評価の完全な内訳は以下の通りです。

Muse Spark 1.2 の詳細やベンチマークについては、Artificial Analysis をご覧ください:https://artificialanalysis.ai/models/muse-spark-1-2
原文を表示
Muse Spark 1.2: Improved Agentic Performance at Higher Cost per Task
Meta’s Muse Spark 1.2 scores 54 on the Artificial Analysis Intelligence Index. Its Meta's third release in four months, significantly improving agentic knowledge work capabilities over prior releases and putting Meta next to SpaceXAI in a tie for third place amongst US labs
Muse Spark 1.2 (xhigh) lands at 54, up 3 points from Muse Spark 1.1 (51) and 11 points from Muse Spark 1.0 (43, April). It enters effectively tied with GPT-5.5 (xhigh, 55) and Grok 4.5 (high, 54), narrowly behind the current frontier models Claude Opus 5 (max, 61), Claude Fable 5 (max w/ fallback, 60), GPT-5.6 Sol (max, 59), and Kimi K3 (max, 57). Meta shared access with us ahead of public release for benchmarking.
要点
➤ Muse Spark 1.2 gets closer to the frontier on agentic knowledge work: At Muse Spark 1.1’s launch, we noted agentic knowledge work as its clearest gap; Muse Spark 1.2’s gains help to close this. Its GDPval-AA v2 Elo rose 260 points to 1631, #5 among all models we have benchmarked and ahead of Claude Opus 4.8 (max, 1588). GDPval-AA v2 is our leading metric for general agentic performance, measuring models on realistic knowledge work tasks such as preparing presentations and analysis, with shell access and web browsing capabilities in an agentic loop via our reference harness Stirrup. Terminal-Bench v2.1, which measures agentic coding and terminal use, gained 2 points (78% to 80%), and τ³-Banking, which measures agentic tool use, rose 2 points (25% to 27%).
➤ Among the most cost-efficient models at its intelligence level: Muse Spark 1.2 costs $0.40 per Intelligence Index task at Meta’s unchanged $1.25/$4.25 per 1M token pricing, with only Grok 4.5 (high, $0.37) and GPT-5.6 Sol (medium, $0.39) cheaper in its intelligence cluster - GPT-5.6 Terra (max, $0.51), Kimi K3 (max, $0.86), and GPT-5.5 (xhigh, $1.18) all cost more per task. The cost increase over Muse Spark 1.1 ($0.29 per task) is driven by increased token usage per Intelligence Index task, with input tokens up ~53% and output tokens up ~36%, concentrated in GDPval-AA v2.
➤ AA-Omniscience abstention rate increases: The score rose from 18 to 22 as the hallucination rate fell 10 points (38% to 28%) and the attempt rate dropped from 82% to 67%. AA-Omniscience measures knowledge reliability and hallucination: it rewards correct answers, penalizes hallucinations, and applies no penalty for declining to answer. Muse Spark 1.2’s heavy abstention (not answering questions when unsure) now drives both the low hallucination rate and a lower accuracy (41% to 38%).
➤ Scientific Reasoning results remain largely unchanged: CritPt, which tests research-level physics reasoning, notably gained 3 points (15% to 18%), while SciCode fell 2 points (58% to 56%) and Humanity’s Last Exam fell 1 point (45% to 44%).
➤ Model details: Muse Spark 1.2 retains Muse Spark 1.1’s 1M token context window and pricing ($1.25/$4.25 per 1M input/output tokens, with cache hits discounted to $0.15 per 1M), and is available on Meta’s first-party API at launch.

Agentic and intelligence evaluations
The 3 point gain over Muse Spark 1.1 on the Artificial Analysis Intelligence Index is concentrated in agentic evaluations: GDPval-AA v2 +260 Elo (1371 to 1631), Terminal-Bench v2.1 +2 points (78% to 80%), and τ³-Banking +2 points (25% to 27%). The minor regressions are SciCode (-2 points) and Humanity’s Last Exam (-1 point).

GDPval-AA v2 Leaderboard
Muse Spark 1.2 ranks #5 on GDPval-AA v2 at 1631 Elo, behind Claude Opus 5 (max, 1852), GPT-5.6 Sol (max, 1730), and Kimi K3 (max, 1685), and ahead of Claude Opus 4.8 (max, 1588). Muse Spark 1.1 scored 1371 at its launch last month.

Intelligence Index vs Cost per Intelligence Index Task
Muse Spark 1.2 sits near the Pareto frontier of Intelligence vs Cost per Intelligence Index Task, at $0.40 per task.

AA-Omniscience Index
Muse Spark 1.2 continues Meta’s AA-Omniscience pattern: the score rose from 18 to 22, driven by abstention for the second consecutive release. The hallucination rate fell 10 points (38% to 28%) as the attempt rate dropped to 67%, while accuracy slipped from 41% to 38%.

Intelligence Evaluations
Full breakdown of the individual evaluations in the Artificial Analysis Intelligence Index:

See Artificial Analysis for further details and benchmarks of Muse Spark 1.2: https://artificialanalysis.ai/models/muse-spark-1-2
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み