Meta、コーディング性能で最前線と主張する Muse Spark 1.3 を発表
本文の状態
日本語全文を表示中
詳細モードで約14分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
VentureBeat AI
Meta は新モデル Muse Spark 1.3 を発表し、開発者が利用可能な xhigh 版でも最上位クラスに達したが、最高性能の max 版は安全性テスト中でまだ公開されていない。
AI深層分析を開く2026年9月4日 01:56
AI深層分析
キーポイント
Muse Spark 1.3 の性能と構成
Meta は Muse Spark 1.3 を発表し、既存モデルより高速かつ高性能となったが、最高性能の max 版は安全性テスト中で現在利用できず、広く展開されているのは xhigh 版である。
ベンチマーク結果の詳細
GDPval-AA や OSWorld などの主要ベンチで xhigh 版も最高峰クラスに達したが、Anthropic の Claude Fable 5.1 が依然としてトップを維持している。
実用性とコストの課題
業界が問うべきは性能が最上位かではなく、企業が今日実際に導入可能なモデルの性能とコストであり、Meta はそのバランスを示した形となった。
コーディングとアジェンシー評価での競合他社との互角な戦い
Muse Spark 1.3 は複数のコーディングおよびアジェンシー評価において、OpenAI や Anthropic と勝敗を争うレベルに達している。
ワークフロー管理とコスト効率の向上
本モデルは長文スレッドでの複数ワークフロー維持や計画の欠陥検知が容易になり、コーディング作業ではツール呼び出しが約 20%、トークン使用量が約 25%削減された。
重要な引用
"Muse Spark 1.3 is rolling out today with frontier performance almost too cheap to meter"
"The version broadly rolling out this week through its Muse Code harness and the Meta Model API uses Meta's previously available reasoning settings, including xhigh."
"Anthropic still occupies the top of the leaderboard: Claude Fable 5.1 reaches 66 at max and 65 at xhigh"
"On several coding and agentic evaluations, it is trading wins with OpenAI and Anthropic."
編集コメントを表示
編集コメント
Meta は最高性能モデルの公開を延期し、代わりに実用レベルの高い xhigh 版を先行投入した。これは開発者がベンチマークの数値に踊らされず、実際の導入環境でのパフォーマンスとコストを重視するよう促す重要な示唆を含んでいる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
昨日発表された Meta の最新 AI モデル「Muse Spark 1.3」は、前作よりも高速で、第三者のベンチマークでも高い性能を示しています。ただし、重要な条件付きです。
Meta の共同創設者兼 CEO マーク・ザッカーバーグ氏は X(旧 Twitter)で、「Muse Spark 1.3 は本日、コストパフォーマンスが極めて優れているにもかかわらず、最先端レベルのパフォーマンスを発揮して展開を開始します」と投稿し、これはコーディングやエージェント作業における Meta 史上最大の飛躍であると評価しました。
この主張の両側面には、確かな根拠があります。Muse Spark 1.3 は先月のバージョン 1.2 と比較して大幅な進歩を遂げました。特に長時間実行されるエージェントタスクでの性能向上が顕著です。現在開発者が利用可能なバージョンは、独立したモデルランキングの上位に位置する、価格対性能比に優れた製品の一つでもあります。
Meta が発表している Muse Spark 1.3 の最も高いベンチマークスコアは、「max reasoning(最大推論)」設定で得られたものです。Meta はこのバージョンについて、追加的な安全性テストを完了中であり「まもなく」公開されると述べています。一方、第三者のベンチマーク調査会社である Artificial Analysis は、限定的なパートナー向けプレビューを通じて max 設定を評価したものの、現時点ではこの構成に対応する API プロバイダーは存在しないと報告しています。
今週、Muse Code ハーネスや Meta Model API を通じて広く展開されるバージョンは、Meta が以前から提供していた推論設定(xhigh など)を採用しています。
つまり、重要な企業向けの問いは「Muse Spark 1.3 が最先端の性能に達できるか」ではなく、「企業が実際に今日導入可能なレベルがどの程度なのか、そしてその実コストはいくらか」という点にあります。
出荷版モデルは非常に優秀ですが、ベンチマークの首位を独占しているわけではありません。
Meta は基礎的な評価レポートにおいて両方の構成の結果を明らかにしており、展開可能なモデルを隠しているわけではありません。しかし、発表資料では最大構成(max)が前面に押し出されており、その一部で最も高いスコアもこの構成が記録しています。
例えば、Meta が報告した GDPval-AA v2 のスコアは、max で 1,754 Elo、xhigh で 1,709 です。OSWorld 2.0 ではそれぞれ 66.9 と 57.2、JobBench では 64.9 と 61.2 となっています。
一方、一部のテストでは差がほとんどないか、逆転することもあります。DeepSearchQA は 89.4 で同点ですが、Terminal-Bench 2.1 では xhigh が 89.2 を記録し、max の 88.8 を上回っています。
Artificial Analysis のインテリジェンス・インデックスでは、Muse Spark 1.3 max が 62、出荷版の xhigh が 61 と評価されています。後者は GPT-5.6 Sol max、Grok 4.6 high、Claude Opus 5 high と同点です。しかし、リーダーボードのトップは依然として Anthropic のモデルが占めています。Claude Fable 5.1 は max で 66、xhigh で 65 を記録し、Claude Opus 5 も max と xhigh の両方で 63 です。
つまり、Muse Spark 1.3 xhigh は確かに最先端クラスに属していますが、現在その最前線をリードしているモデルではありません。
これは Muse Spark 1.2 からすれば大きな変化です。先月の発表を報じた VentureBeat の記事では、Meta が Anthropic の最高峰モデルには全体的に及ばないものの、信頼できるコーディング対抗馬を提示していると伝えられていました。Muse Spark 1.2 は Terminal-Bench 2.1 で 82.9% を記録しましたが、Opus 5 の 86.7% には及びませんでした。Meta が発表した他の主要なコーディング比較でも、同様に Opus に劣る結果でした。
バージョン 1.3 の登場により、Meta は単にその競争に参加しているだけでなく、複数のコーディングおよびエージェント評価において OpenAI や Anthropic と互角の戦いを繰り広げています。
Meta によると、基盤モデルは運用がより容易になりました。Muse Spark 1.3 は、長いスレッド内で複数のワークフローを維持し、ツールを使って文脈を集約し、自身の計画に隙間がないか検出し、必要に応じてユーザーに確認を求め、重大なアクションを実行する前に確認を取るようトレーニングされています。Meta のエンジニアによる内部比較では、コーディング作業において 1.2 よりもツールの呼び出し回数が約 20% 少なく、トークン使用量が 25% 少ないことが示されました。
数千から数百万回のエージェントループを課金対象とする企業にとって、これらの行動面での改善は、単なるリーダーボードの順位よりも重要になる可能性があります。
「メーターリングするほど安すぎる」という表現は、Meta が価格を引き下げたことを意味しません。
Muse Spark 1.3 の API 価格は据え置かれました。Meta は Muse Spark 1.2 と同じ標準価格を維持しています:入力トークン 100 万あたり 1.25 ドル、出力トークン 100 万あたり 4.25 ドル、キャッシュされた入力トークン 100 万あたり 0.15 ドルです。
- モデル:入力 ($/1M) / 出力 ($/1M) / 合計 ($/1M) / ソース
- Muse Spark 1.2 / 1.3 Contributor:$0.10 / $0.20 / $0.30 / Meta
- MiMo-V2.5 Flash:$0.10 / $0.30 / $0.40 / Xiaomi
- DeepSeek-V4-Flash — off-peak:$0.22 / $0.66 / $0.88 / DeepSeek
- GPT-5.6 Luna:$0.20 / $1.20 / $1.40 / OpenAI
- MiniMax-M3:$0.30 / $1.20 / $1.50 / MiniMax
- LongCat-2.0 — limited-time promo:$0.30 / $1.20 / $1.50 / LongCat
- DeepSeek-V4-Flash — peak hours:$0.44 / $1.32 / $1.76 / DeepSeek
- MiMo-V2.5:$0.40 / $2.00 / $2.40 / Xiaomi
この価格表は、Zuckerberg氏が「メーターに値しないほど安すぎる」と述べた背景を浮き彫りにしています。これは単にトークン単価が下がったことへの言及ではなく、Meta が開発者にとってこれらのトークンで何が可能になると考えているかを強調するものです。
DeepSeek-V4-Pro — 非ピーク時
$0.66
$1.98
$2.64
DeepSeek
LongCat-2.0 — スタンダード
$0.75
$2.95
$3.70
LongCat
MiMo-V2.5 Pro (≤256K)
$1.00
$3.00
$4.00
Xiaomi
Gemini 3.7 Flash — 2026年12月31日まで
$0.75
$3.75
$4.50
Gemini 3.8 Flash — 2026年12月31日まで
$0.75
$3.75
$4.50
DeepSeek-V4-Pro — ピーク時
$1.32
$3.96
$5.28
DeepSeek
Muse Spark 1.1 / 1.2 / 1.3
$1.25
$4.25
$5.50
Meta
GLM-5.3
$1.40
$4.40
$5.80
Z.AI
Grok 4.6 — プロンプトトークン<200K
$2.00
$6.00
$8.00
xAI
MiMo-V2.5 Pro (>256K)
$2.00
$6.00
$8.00
Xiaomi
Qwen3.8-Max
$2.00
$6.00
$8.00
QwenCloud
Gemini 3.7 Flash — 2027年1月1日から
$1.50
$7.50
$9.00
Gemini 3.8 Flash — 2027年1月1日から
$1.50
$7.50
$9.00
GPT-5.6 Terra
$2.00
$12.00
$14.00
OpenAI
Grok 4.6 — プロンプトトークン≥200K
$4.00
$12.00
$16.00
xAI
GPT-5.4
$2.50
$15.00
$17.50
OpenAI
Kimi K3
$3.00
$15.00
$18.00
Moonshot AI
Claude Opus 5
$5.00
$25.00
$30.00
Anthropic
Sakana Fugu Ultra (≤272K)
$5.00
$30.00
$35.00
Sakana AI
GPT-5.6 Sol — スタンダードモード
$5.00
$30.00
$35.00
OpenAI
Claude Fable 5 / Claude Mythos 5
$10.00
$50.00
$60.00
Anthropic
Claude Fable 5.1 / Claude Mythos 5.1
$10.00
$50.00
$60.00
Anthropic
GPT-5.6 Sol — ファストモード
$10.00
$60.00
$70.00
OpenAI
Artificial Analysis のデータはこの主張を裏付ける一方で、新たな複雑さを示しています。同社が測定したところ、Muse Spark 1.3 xhigh は出力トークンあたり秒間 235.2 トークンを処理し、インテリジェンス指数(Intelligence Index)のタスクあたりのコストは約 0.55 ドルと算出されました。
インテリジェンス指数で 61 を記録したこのモデルは、同レベルで現在測定されているモデルの中で最もタスクあたりのコストが低いことになります。
一方、Muse Spark 1.2 はスコア 57 で、Artificial Analysis のタスクあたりコストはわずか 0.40 ドルでした。
トークン単価の変更はないものの、独立したベンチマークの結果によると、平均的なタスク完了にかかるコストは世代間で増加しています。この増加分の主な要因として、Artificial Analysis はエージェント評価における入力トークンの消費量の増加を挙げています。
これは Meta が主張する「トークン使用量が 25% 削減された」という点と直接矛盾するものではありません。Meta の比較対象は自社のコーディングワークフロー内での結果であり、Artificial Analysis が測定しているのはより広範な推論タスクやエージェントタスクのセットだからです。
しかし、これはモデルがエージェントとして動作し始めた際、「安価」という概念がいかに曖昧になりやすいかを如実に示しています。トークンレート、推論に要するコスト、対話のターン数、ツール呼び出し、リトライ回数など、実際の作業完了にかかる費用はこれらすべての要素によって構成されます。
Meta はまた、プロンプトや回答をトレーニングデータとして利用することを許可する見返りに、従来通り異常なほど低廉な「Contributor」プランも維持しています。これは入力トークン 100 万あたり 0.10 ドル、出力トークン 100 万あたり 0.20 ドルという価格設定です。
VentureBeat が Muse Spark 1.2 の際に指摘した通り、プロトタイピングには魅力的なツールですが、独自コードや機密情報を扱う企業にとっては、データガバナンスの計算が根本的に異なるものになります。
王氏の「Gemini は誰?」という発言は、驚くほど直接的な比較でした。
Meta の最高 AI 責任者であるアレクサンダー・王氏は、今回のリリースを祝う際、非常に控えめな姿勢を見せました。
Artificial Analysis が Muse Spark の結果を発表した後、王氏は X(旧 Twitter)でそれを転載し、「本当は言いたくないのですが…でも、Gemini は誰?😱💨」と投稿しました。
この皮肉が特に鋭かったのは、Google が同日に Gemini 3.8 Flash をリリースしたためです。同社はこれを、長期的なソフトウェアエンジニアリング、自律型エージェント、多段階の専門的推論といった、Muse Spark とほぼ同じワークロードクラス向けに位置づけました。Google は 3.8 を「これまでで最も優れた推論およびコーディング用 Flash モデル」と称し、6 週間で 3 回目の Flash リリースであると発表しています。
独立した数値データは、王氏にとって議論の材料にはなりますが、決定的な勝利を意味するものではありませんでした。
Artificial Analysis の評価によると、Muse Spark 1.3 xhigh はタスクあたり 0.55 ドルで知能指数スコア 61 を記録しました。一方、同様の推論強度を持つ Gemini 3.8 Flash はスコア 59 でタスクコストは 0.58 ドルです。Meta はこれらの特定の設定において、Google をわずかに上回る知能性とタスクコストの優位性を示しています。
スループット性能では Google が明確に勝利しています。Artificial Analysis の測定によると、Gemini 3.8 Flash は出力トークンあたり約 305 トークンを処理するのに対し、Muse Spark は 235 トークンです。これは Muse Spark よりも約 30% 高速です。
また現時点では、Google の API 利用料の方が安価です。Google は導入期間として、入力トークン 100 万あたり 0.75 ドル、出力トークン 100 万あたり 3.75 ドルを請求しています。一方、Meta はそれぞれ 1.25 ドルと 4.25 ドルです。
この Google のプロモーション価格は 12 月 31 日で終了します。それ以降は、入力トークン 100 万あたり 1.50 ドル、出力トークン 100 万あたり 7.50 ドルに値上げされます。
この結果は、最先端モデルの経済性がどれほど厳しくなっているかを示す有用なスナップショットと言えます。Meta は現在のところ、独立した比較において Intelligence Index で 2 ポイント、ベンチマークタスクあたりのコストで 3 セント優位に立っています。一方 Google は、プロモーション期間中に大幅に高い出力スループットと低廉なトークン価格を提供しています。
Wang 氏の「gemini who?」という発言は、経営陣同士の楽しい雑談として楽しむべきものです。しかしエンタープライズアーキテクトの視点では、答えはもう少し現実的です。「Gemini は高速な選択肢であり、Muse は現在のところ、この独立した指標に基づけば、やや強力な高負荷エージェントである」というのが実情です。
Meta のオープンウェイト戦略の変遷
一部の開発者にとって、より重要な課題は今日のベンチマーク競争とは関係ないかもしれません。
Meta が 8 月に Muse Code と Muse Spark 1.2 を発表した際、VentureBeat は同社が Llama で知られるオープンウェイト戦略から劇的に方向転換した点を指摘しました。
メタは、Muse Code と Spark 1.2 をプロプライエタリな API ベースの製品として提供していました。これは「オープン AI が未来への道である」と長年主張してきた同社にとって、驚くべき姿勢でした。
それからわずか5日後、メタは方針を再び転換しました。
8月10日、30億パラメータの「Muse Glimmer」が Apache 2.0 ライセンスの下で公開されました。ザッカーバーグ氏はまた、「今後数週間で Muse Spark 1.2 の重みもオープンソース化する」と発言しました。ロイター通信は独自に、メタが Spark 1.2 の重みをリリースする計画を持っていると報じています。
しかし現在、メタは代わりに Muse Spark 1.3 を新たなプロプライエタリモデルとして出荷しました。
これはまだ約束違反にはあたりません。「今後数週間」という表現は、3週間を超える期間を指すとしても妥当だからです。ただし、今日の発表により、ロードマップが以前よりも不明瞭になったのは事実です。
メタの新しい投稿では Muse Spark 1.2 に言及していません。代わりに、「Muse Spark のオープンウェイト版リリース」がロードマップに含まれていると述べるにとどまり、バージョン名、リリース日、モデルサイズ、ライセンスについては特定していません。ザッカーバーグ氏も X(旧 Twitter)で「Muse Spark のオープンウェイト版はまもなく登場する」と発言しました。
ダウンロード可能な重みによるセルフホスティング、カスタマイズ、推論コストのコントロールを重視し、Llama に標準化を進めてきたチームにとって、この曖昧さは、Spark が複合ベンチマークでさらに1ポイント稼いだかどうかよりも重要かもしれません。
Muse Spark 1.3 は、Meta が独自開発の最先端モデルを驚異的な速度で進化させられるようになったことを示しています。現在出荷されている「xhigh」構成は高速で競争力のある価格設定であり、独立系のランキングでも従来のバージョンよりも上位に位置しています。また、「max preview」版では、より多くの推論計算リソースを投入できる場合に、同シリーズの性能をさらに引き上げられる可能性が示されています。
次の課題は、この開発スピードを企業が実際に計画に組み込めるロードマップに変えられるかどうかです。具体的には、Meta が持つ最良の機能を広く展開可能にする仕組みと、すでに公開予定であると述べているオープンウェイト版「Spark」モデルの実現が求められています。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み