Meta、コーディングでMuse Spark 1.3公開しGemini上回ると主張
本文の状態
日本語全文を表示中
詳細モードで約10分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The New Stack AI
Meta はコーディングとエージェントタスクにおける最大の飛躍を遂げた低コスト推論モデル「Muse Spark 1.3」を発表し、競合他社を上回るベンチマーク結果を示した上で、オープンウェイト版の公開を間近に控えている。
AI深層分析を開く2026年9月4日 00:53
AI深層分析
キーポイント
Muse Spark 1.3 の性能向上と発表
Meta はコーディングおよびエージェントタスクにおける最大の進歩を遂げた低コスト推論モデル「Muse Spark 1.3」を発表し、CEO マーク・ザッカーバーグはこれを「メーター料金がほぼ不要なほど安価でフロンティア級の性能」と評価した。
ベンチマーク結果と競合比較
Meta が独自に実施したベンチマークでは、Muse Spark 1.3 が DeepSWE コーディングベンチで75.4%、長文コンテキストテストで98.1%を記録し、OpenAI の GPT-5.6 Sol や Anthropic の Claude Opus 5 を上回る結果を示した。
オープンウェイト版の公開予告
ザッカーバーグは Muse Spark シリーズのオープンウェイト版が「まもなく」公開されると明言したが、利用や改変に関する具体的なライセンス条件はまだ公表されていないため、詳細は今後の発表に依存する。
次期モデル Watermelon の示唆
ザッカーバーグは水melonの絵文字を用いて、Spark よりも大規模な次期モデル「Watermelon」の開発を示唆し、7 月時点で訓練中だったことが報じられているが、具体的なリリース時期はまだ未定である。
テスト条件の制限と独自評価
Meta の公式スコアは同社の API で生成されたが、比較対象は複数のソースを混合したものであり、独立した同一条件下での対戦結果ではない。
重要な引用
This is the biggest jump we've made so far on coding and agentic work.
frontier performance almost too cheap to meter
Open-weight release 'coming soon'
"Gloves are off!"
編集コメントを表示
編集コメント
Meta は自社ベンチマークで競合を凌駕する結果を示したが、ライセンス条件が未定である点と、ベンチマークの独自性には注意が必要である。低コストでの高性能化は業界全体の価格競争を激化させる可能性があり、開発者はオープンウェイト版の公開タイミングと利用規約を注視する必要がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

AI 界隈において、Meta は今週大きな動きを見せました。まずベータ版を終了し、3 つの新しいサブスクリプションプランを設けて「Muse Code」コーディングエージェントを正式にリリース。その直後の水曜日の夜には、低コスト推論モデルの最新バージョンである「Muse Spark 1.3」を発表しました。Meta は今回のアップデートで、コーディングやエージェントタスクにおける最大の進歩を遂げたと主張しています。
Muse Code や Meta Model API を通じて利用可能な Muse Spark 1.3 は、今年 4 月に初めて導入された推論モデルの最新バージョンです。前バージョンである Muse Spark 1.2 がリリースされてからわずか 1 ヶ月足らずでの登場となります。Meta のマーク・ザッカーバーグ CEO はソーシャルメディアで新リリースを熱く紹介し、「計り知れないほど安価ながら、最先端のパフォーマンスを実現した」と評しました。
「これはコーディングやエージェントタスクにおいて、これまでで最大の飛躍です」
X(旧 Twitter)上でザッカーバーグ氏はこう記しています。
オープンウェイト版のリリースも間もなく
ザッカーバーグ氏はまた、Muse Spark のオープンウェイト版が「まもなく公開される」と明かしました。これにより、開発者は Meta が提供するホスト型 API を経由せずとも、自社のインフラ上でモデルをダウンロードして実行できるようになる可能性があります。
ただし、このモデルがどの程度利用制限を緩めるものかは不明です。Meta はまだ公開されるライセンス条項を発表していないため、その詳細次第で Spark の改変や再配布、展開の自由度が決まります。
注目すべきは、ザッカーバーグ氏が「メロンの絵文字」を使って、多くの期待を集めている次期モデル「Watermelon」にも触れたことです。
Muse Spark 1.3 は本日リリースされ、その性能はコストパフォーマンスが極めて高いものとなっています。これはコーディングやエージェントタスクにおいて、これまでで最大の飛躍です。Muse Code や API でぜひお試しください。
次はメロンの絵文字🍉と、間もなく公開される Muse Spark のオープンウェイト版です。
— Mark Zuckerberg (@finkd) 2026年9月2日
このモデルは Spark よりもはるかに大規模なシステムであり、当時の Business Insider の報道によると、7 月時点でもまだ訓練中だったとされています。Watermelon がいつ公開されるかについては確定的な情報はありませんが、ザッカーバーグ氏の発言からは間もなく登場するとの示唆があります。
現時点では、Meta は Spark 1.3 について大きな成果を主張しています。ザッカーバーグ氏は投稿にベンチマーク表を添付し、このモデルを OpenAI の GPT-5.6 Sol や Anthropic の Claude Opus 5 と比較しました。比較項目はコーディング、エージェントタスク、コンピュータ操作、長文コンテキストのテストです。
その中でも特に目立つ数値として、Muse Spark 1.3 は DeepSWE コーディングベンチで 75.4%、MRCR の 512K-1M バージョンでは 98.1% を記録しました。
imageMuse Spark 1.3: ベンチマーク結果
ただし、これはメタがまとめたデータです。同社によると、Spark 1.3 のスコアは「Meta Model API」を通じて生成されたものであり、比較対象の数値は、メタ自身の評価、公式リーダーボード、競合他社が報告した結果を混合して算出されています。また、メタはサードパーティ製モデルのテストについて「ベストエフォート(最善を尽くす)」と説明しており、この表は同一条件で実施された独立した直接対決の結果として解釈すべきではありません。
さらに注意が必要です。今回の主要な比較では、Spark 1.3 を新しい推論レベル「max」で実行しましたが、現在開発者が一般的に利用可能な最高レベルは「xhigh」です。「max」はまだ限定プレビュー段階にあり、メタが追加の安全性テストを完了するまで公開されません。
「ガチンコ勝負」:Spark 1.3 の実力
一方、人工知能ベンチマーク専門企業である Artificial Analysis による独立したテスト結果も参考になります。サンフランシスコに拠点を置く同社は、一般公開されている Muse Spark 1.3(xhigh)の「インテリジェンス・インデックス」で 61 点を付与しました。これは Spark 1.2 より 4 ポイント高く、GPT-5.6 Sol max、Grok 4.6 high、Claude Opus 5 と同点です。
また、限定プレビュー版の「max」バージョンもテスト可能でした。このバージョンは 62 点を獲得し、リリース時点での比較対象モデルの中で Claude Fable 5.1 と Claude Opus 5 に次ぐ順位となりました。
image人工知能分析インデックス(出典:Artificial Analysis)
クラウドインフラ企業 CoreWeave の AI エバンジェリスト、アレク・ヴォルコフ氏はこのチャートを示し、メタが主要モデルとの差をいかに短期間で縮めたかを解説しています。
「ついに本気モードか!」と X で書き込み、メタの発表について「非常に力強い声明だ」と評価。その上で、「これからの数週間は忙しくなるだろう」と予測しました。
「ついに本気モードか!」
コストもメタが強調するポイントの一つです。Artificial Analysis は Spark 1.3 xhigh を、測定された知能レベルにおいて「最もコスト効率に優れたモデル」と評価しています。61 のインデックススコアと、他社と比較して低いタスクあたりのコストを組み合わせることで、同社のパレート最適ライン上に位置づけられています。
imageインデックススコア別 1 単位あたりのコスト(出典:Artificial Analysis)
Artificial Analysis の計算によると、Spark 1.3 xhigh のインデックスタスクあたりのコストは約 0.55 ドルで、同インデックスで 59 以上のスコアを持つモデルの中で最も低くなっています。同じく 61 のスコアを記録した GPT-5.6 Sol max と Grok 4.6 high は、それぞれ 0.95 ドル、0.94 ドルでした。
Spark 1.3 はタスクあたりのコストが Spark 1.2 の 0.40 ドルより高くなっていますが、Artificial Analysis はこの増加分の主な原因を、エージェント評価において新しいモデルが入力トークンを約 57% 多く消費した点にあると分析しています。
image知能指数タスクあたりのコスト(提供:Artificial Analysis)
Muse と Gemini の対決は、まるで「遊び場での喧嘩」のようだ。
Meta が Muse Spark 1.3 を発表する直前に、Google もまた低価格帯モデル「Gemini 3.8 Flash」をリリースしていた。これはわずか6週間で3回目となる Flash シリーズの新作だ。Google はこのモデルを「これまでで最も推論とコーディングに優れた Flash モデル」としてアピールしつつ、導入価格は入力トークン100万あたり0.75ドル、出力トークン100万あたり3.75ドル据え置いた。
Artificial Analysis の初期評価では、Gemini 3.8 Flash(高設定)は「知能対コストのパレートフロンティア」に位置づけられた。これは、より高性能かつ安価な代替モデルが存在しない、最も効率的なモデル群を指す指標だ。このモデルは1タスクあたり0.58ドルで知能指数59点を記録した。
しかし、わずか数時間後、Muse Spark 1.3 xhigh が登場し、知能指数61点、1タスクあたり0.55ドルという結果を叩き出した。性能とコストの両面で Gemini 3.8 Flash を上回り、パレートフロンティアからその座を奪ったのだ。
「Google は数時間だけ先行していたに過ぎない」
この点は AI コミュニティの多くが認識している。実際、AI リサーチャーのベンジャミン・マリー氏は X(旧 Twitter)でこう投稿した。「Google は数時間だけ先行していたに過ぎない。そして Meta はモデルの重みも公開する」。
— Benjamin Marie (@bnjmn_marie) 2026年9月2日
AI インフラおよび研究企業 Prime Intellect のリサーチエンジニア、フローリアン・ブランド氏も、この逆転劇を簡潔に要約している。
「Gemini 3.8 は、パレートフロンティア(最適解の集合)において約 3 時間半、その地位を維持していました」とブランド氏は X で投稿しました。
そして、メタの最高 AI 責任者であるアレクサンダー・ワング氏自身もコメントし、人工知能分析レポート(Artificial Analysis report)を根拠に Google を批判する姿勢を見せました。
正直、そう言いたくないのですが…
Gemini は誰?🏎️💨 https://t.co/Umv4CVqgre
— Alexandr Wang (@alexandr_wang) 2026 年 9 月 2 日
しかし、クラウドおよび AI コスト管理企業ダックビル(Duckbill)の共同創設者兼最高クラウドエコノミストであるコリー・クイン氏は、このやり取りをすぐに皮肉り、「AI におけるメタと Google の批判合戦は、総合格闘技チャンピオンシップ大会の外で行われている子供同士の喧嘩に過ぎない」と X で書き込みました。
Muse Code が登場
背景として、Muse Spark 1.3 はメタが今年 4 月以来出荷したモデルの第 4 版です。7 月の Muse Spark 1.1 に続き、その翌月には 1.2 がリリースされました。しかし、メタの取り組みにおいてより重要なのは、このモデルを取り巻くエージェント・ハネス(agent harness)の構築です。
それが「Muse Code」です。これはメタが提供するターミナルベースのコーディングエージェントで、8 月初旬に Spark 1.2 と同時にベータ版として登場しました。そして火曜日に正式リリースされ、月額わずか 5 ドルから利用可能な新しいサブスクリプションプランや、開発者向けプレビュー版として提供される新たな SDK を備えています。
Meta は明らかにモデル品質において最先端のラボ群と競争しようとしており、Muse Spark ラインナップでの改善がその証左です。しかし同時に、Anthropic の Claude Code や OpenAI の Codex が示したように、開発者が日常的にエージェントとどのように連携するかという「次のレベル」への追及も進めています。
この背景こそが、1.3 リリースの発表内容の多くがコーディングやエージェント作業に焦点を当てている理由です。Meta は現在、機能面だけでなく価格競争力にも注力する広範な開発者プラットフォームを推進しており、その中核となるのがこのモデルです。
「Google は数時間先行していたに過ぎない」:Muse Spark 1.3 が Gemini をわずかに上回り、Meta が最大のコーディング飛躍を達成したと主張
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み