Meta AI、コーディング用エージェントモデル「Muse Spark 1.3」を公開
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
Meta Superintelligence Labs は長期的エージェント作業とコーディングに特化した「Muse Spark 1.3」を公開し、前バージョンよりツール呼び出しが約20%、トークン使用量が約25%削減されたことを発表した。
AI深層分析を開く2026年9月4日 04:10
AI深層分析
キーポイント
効率性の大幅な向上
Meta の内部比較によると、Muse Spark 1.3 は前バージョンに対しツール呼び出しが約20%減少し、トークン使用量が約25%削減された。
エージェント機能の強化
本モデルは単発生成ではなく長期的なワークフローを維持し、不明確な指示に対して質問を行い、停滞時にはユーザーに協力を求める機能を備えている。
ベンチマークでの競合他社を上回る性能
DeepSWE v1.1 で 75.4 を記録し Claude Opus 5 や GPT-5.6 Sol を上回り、長文コンテキスト検索では明確な差をつけている。
デプロイ制限と利用形態
Muse Code と Meta Model API で利用可能だが、モデル重みはクローズドであり自己ホストはできず、最大推論モードは安全テスト待ちである。
Artificial Analysisによる性能評価
xhighとmaxの両バージョンが Banking ベンチマークで過去最高スコアを記録し、xhighはGPT-5.6 SolやGrok 4.6と同水準となる。
重要な引用
Meta trained Muse Spark 1.3 across multiple agent harnesses so behavior generalizes past one environment.
Muse Spark 1.3 asks clarifying questions on ambiguous prompts, pulls the user in when it stalls, and confirms before consequential actions.
Relative to Muse Spark 1.2, Meta describes fewer unnecessary turns, less verbosity, and a cleaner code style.
Muse Spark 1.3 is live in Muse Code and the Meta Model API, with a 1M-token context window.
編集コメントを表示
編集コメント
Meta は長期的なエージェント作業に特化したモデルの進化を加速させており、コスト削減と信頼性の向上が実用化への鍵となっている。競合他社とのベンチマーク比較において明確な優位性を示す一方で、クローズドな性質は自己ホストを求める開発者にとって依然として制限となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
今週、Meta Superintelligence Labs が「Muse Spark 1.3」をリリースしました。これは 5 ヶ月間で 4 回目となる更新で、単発の生成タスクではなく、長期にわたるエージェント作業やコーディング支援を目的としています。Meta の発表では、使いやすさが重視されています。具体的には、長い会話スレッドを維持し、ユーザーと協力し、行き詰まった時にどう対処するかという点です。
実運用できるのでしょうか?はい、可能です。ただし 2 つの制限があります。Muse Spark 1.3 は「Muse Code」および「Meta Model API」を通じて本日利用可能になり、生産環境での呼び出しも即座に開始できます。しかし、モデルの重み(weights)がクローズドであるためセルフホストはできません。また、推論モードの最大性能は、さらなる安全性テストの結果次第で制限されています。
エージェントにとって何が実際に変わったのか
Meta は Muse Spark 1.3 を複数のエージェント環境で訓練し、単一の環境に依存しない汎用的な振る舞いを実現しました。このモデルは、1 つの長いスレッド内で複数のワークフローを保持できるように設計されています。オープンエンドな目標が与えられた際、不整合や混乱のある情報源から自ら文脈を集め、計画の隙間を埋めることができます。
より実用的なのはコラボレーション機能の強化です。Muse Spark 1.3 は曖昧な指示に対して明確化のための質問を行い、行き詰まった際にはユーザーを巻き込みます。また、重要なアクションを実行する前には必ず確認を取ります。長時間の実行時にはユーザーの好みに適応し、頻繁なステータス更新を行うか、あるいはバックグラウンドで静かに実行するかを選択します。Meta によると、モデル自身の限界に対する評価精度も向上しており、結果をでっち上げるのではなく、障害物を明確にフラグとして示すようになりました。
マルチタスク性能も向上しました。Meta によると、このモデルはユーザーが操作を制御している場合や中断された場合でも、複雑な単一スレッド内にある適切なタスクに入力プロンプトをマッピングします。
コーディングと効率性
Muse Spark 1.3 は、より長期にわたるコーディングタスクのデータでトレーニングされました。Muse Spark 1.2 と比較すると、Meta は不要なやり取りが減り、冗長性が抑えられ、コードスタイルが洗練された点を挙げています。Meta エンジニアによる内部評価では、必要なツール呼び出しが約 20% 減少し、使用トークン数が約 25% 削減されました。エージェントワークロードにおいて、これはコストに直結する指標です。タスク完了までの往復回数が減り、課金対象となるトークン数も少なくなるためです。
ベンチマーク結果
Meta が発表した数字によると、Muse Spark 1.3 は DeepSWE v1.1 で 75.4 を記録し、Claude Opus 5 の 74.0 や GPT-5.6 Sol の 72.7 を上回りました。また、SWE-Atlas Codebase QnA では 59.4 に達し、Terminal-Bench 2.1 では GPT-5.6 Sol と同点の 88.8 を記録しました(Opus 5 は 86.7)。特に長文コンテキストの検索能力において大きな差が見られ、MRCR v2 のスコアは 98.5(256K〜512K)および 98.1(512K〜1M)でした。一方、GPT-5.6 Sol はそれぞれ 91.5 と 73.8 です。
エージェントタスクにおけるモードの違いも重要です。Meta の報告では、OSWorld 2.0 で最大値が 66.9 に対し xhigh モードは 57.2、GDPval-AA v2 Elo は 1,754 対 1,709、JobBench では 64.9 対 61.2 となりました。DeepSearchQA は両者とも同点の 89.4 です。Muse Spark 1.2 が xhigh モードで評価されたことを考慮すると、世代間の飛躍には推論レベルの変更も一部含まれていることがわかります。
Artificial Analysis のスコアによると、Muse Spark 1.3 の xhigh バリアントはインテリジェンス指数で 61 点、プレビュー版の max バリアントは 62 点を記録しました。このスコアは GPT-5.6 Sol (max) や Grok 4.6 (high) と同等ですが、Claude Opus 5 (max, 63 点)、Claude Fable 5.1 (max, 66 点) には及びません。
また、Banking タスクの Tau3-Bench では、xhigh が 47%、max が 52% を達成しました。これは同ベンチマークで記録された最高スコアです。
主なポイント
- Muse Spark 1.3 は、Muse Code および Meta Model API で利用可能になりました。コンテキストウィンドウは 100 万トークンです。
- Meta エンジニアらの測定によると、前バージョンの Muse Spark 1.2 と比較して、ツール呼び出しが約 20% 減少し、使用トークン数が約 25% 削減されています。
- Meta が発表した評価スコアは max モードに基づいていますが、現時点で開発者が直接呼び出せるのは他のモードです。
- 料金は据え置きのままです。入力 100 万トークンあたり 1.25 ドル、出力 100 万トークンあたり 4.25 ドルで、コントリビューター向けにはそれぞれ 0.10 ドル、0.20 ドルの tier が用意されています。
- モデルの重みはクローズドなままですが、Meta は将来のロードマップに Muse Spark のオープンウェイト版公開を予定しています。
詳細は公式リリース記事および評価手法に関するレポートをご覧ください。また、Twitter でフォローしたり、15 万人以上の ML 専門家が参加する SubReddit に加入したり、ニュースレターに登録することもおすすめです。Telegram をご利用の方も、今ならこちらからご参加いただけます。
GitHub リポジトリや Hugging Face ページ、製品リリース、ウェビナーなどのプロモーションをご検討の場合は、ぜひパートナーシップについてお問い合わせください。
※本記事は MarkTechPost に掲載された「Meta AI Released Muse Spark 1.3: An Agentic Coding Model That Uses ~20% Fewer Tool Calls and ~25% Fewer Tokens Than Muse Spark 1.2」を基にしています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み