8 日間で 4 社が AI インデックス 50 超え、6 機関が最前線に
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Artificial Analysis
Artificial Analysis の発表によると、過去8日間に4つの新モデルが投入され、知能指数50超のラボが2から6に増加し、トップ3のスコア差も縮小した。
AI深層分析を開く2026年8月1日 14:11
AI深層分析
キーポイント
frontier ラボ数の急増
SpaceXAI、OpenAI、Meta、Moonshot AI の4社が相次いでモデルをリリースし、知能指数50以上のラボ数が2から6に倍増した。
Kimi K3 の高スコア登場
Moonshot AI の Kimi K3 が総合3位(57点)にランクインし、特に知識作業や分析品質においてトップモデルと互角の性能を発揮した。
コストパフォーマンスの劇的改善
同等の知能レベルを持つモデルが相次いで登場した結果、近 frontier レベルのインテリジェンス利用コストが8日間で2〜3倍低下した。
8日間で6つの新モデルが50点台に到達
Anthropic、OpenAI、Moonshot AI、SpaceXAI、Z AI、Metaの6社が過去8日間に新たに50点以上のモデルを発表し、Artificial Analysis Intelligence Indexで競い合っている。
トップ争いの激化と多極化
2022年末以降は1〜2社が首位を独占していたが、6月初旬以降はSpaceXAI、Moonshot AI、Meta、Z AIが1位との差を1桁以内まで縮めている。
重要な引用
The frontier has opened up: four frontier launches in eight days - Grok 4.5, GPT-5.6, Muse Spark 1.1, and Kimi K3.
Kimi K3 scores 1668 Elo on GDPval-AA v2, third behind Claude Fable 5 (max, 1760) and GPT-5.6 Sol (max, 1748).
Near-frontier intelligence got 2-3x cheaper in eight days.
Six labs now field a model above 50 on the Artificial Analysis Intelligence Index: Anthropic (Claude Fable 5, 60), OpenAI (GPT-5.6 Sol, max, 59), Moonshot AI (Kimi K3, 57), SpaceXAI (Grok 4.5, high, 54), Z AI (GLM-5.2, max, 51), and Meta (Muse Spark 1.1, xhigh, 51).
編集コメントを表示
編集コメント
短期間でのモデル投入頻度とスコア分布の変化は、業界の成熟度を示す重要な指標である。特にコスト低下が顕著な点は、実務利用における障壁低下に直結する動きと言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
「最先端」の壁が崩れ、わずか8日間で4つの新モデルが登場しました。Grok 4.5、GPT-5.6、Muse Spark 1.1、そして Kimi K3 です。これにより、Artificial Analysis Intelligence Index でスコア50を超えるモデルを持つラボは2つから6つに増えました。
SpaceXAI の「Grok 4.5(高評価、スコア54)」が7月8日に登場しました。そのわずか2日後には、OpenAI の「GPT-5.6 Sol/Terra/Luna(最高評価、それぞれスコア59/55/51)」と Meta の「Muse Spark 1.1(超高評価、スコア51)」が続きます。さらに7月16日には Moonshot AI の「Kimi K3」がスコア57で登場し、Claude Opus 4.8(最高評価、スコア56)を抜いて総合3位となりました。
現在、インデックス上位3モデルはそれぞれ異なるラボから生まれ、スコアの差はわずか3ポイントです。7月8日以降に登場した上位10モデルのうち4つが、6月初旬以降ではなんと6つに上ります。
唯一変化しなかったのは1位のみです。「Claude Fable 5(スコア60)」は6月9日以来トップの座を守り続けていますが、そのリード幅は4ポイントから1ポイントに縮小。さらに、その下位のモデル群の価格が急落しています。
SpaceXAI、OpenAI、Meta、Moonshot AI の各チームには、この目を見張る8日間をありがとうと言いたいです。
主要なポイント:
➤ 最先端の戦線は6週間で2ラボから6ラボへ拡大。 6月まで、インデックスで51以上のスコアを出すモデルを持っていたのは Anthropic と OpenAI のみでした。GLM-5.2(最高評価、スコア51)が Z AI を6月中旬に戦線に加えました。先週は SpaceXAI が Grok 4.5(高評価、スコア54)、Meta が Muse Spark 1.1(超高評価、スコア51)で合流し、Kimi K3 によって Moonshot AI が6番目のラボとしてスコア57で参入しました。
➤ Kimi K3 が「エージェント機能」と「知識作業」のスコアでトップ 2 に次ぐ第 3 位に登場。 GDPval-AA v2 ベンチマークでは 1668 Elo を記録し、最高値 1760 の Claude Fable 5 と最高値 1748 の GPT-5.6 Sol に次いで 3 位となりました。また、長期の知識作業を評価する独自のベンチマーク「AA-Briefcase」では 1547 Elo で 2 位にランクイン。これは最高値 1583 の Claude Fable 5 に次ぎ、最高値 1495 の GPT-5.6 Sol を上回る結果です。分析品質スコア(Analytical Quality Elo)は 1760 で、Claude Fable 5 の 1764 とほぼ同等の性能を示しました。知能指数タスクあたり 0.94 ドルという価格設定で、入力・出力トークン 100 万あたりの料金がそれぞれ 3 ドルと 15 ドルの Kimi K3 は、Claude Opus 4.8(最高値 1.80 ドル)に匹敵する知能を、タスクあたり約半分のコストで提供します。
➤ ほぼ最前線の知能モデルが、わずか 8 日で 2〜3 倍の価格低下を実現。 GPT-5.6 Sol(最高値)は、Claude Fable 5(最高値)よりわずかに下回る性能ながら、知能指数タスクあたりのコストを 1.04 ドルに抑え、Claude の 2.75 ドルと比較して大幅な低価格を実現しました。Grok 4.5(ハイ)はスコア 54 で 0.31 ドルを提供し、これは GPT-5.5(エクストラハイ、0.99 ドル)の 3 分の 1 を下回る価格です。スコア 51 の GPT-5.6 Luna(最高値、0.21 ドル)と Muse Spark 1.1(エクストラハイ、0.26 ドル)は、先週まで同レベルで最安だった GLM-5.2(最高値、0.32 ドル)を価格面で下回りました。
Artificial Analysis の知能指数で 50 を超えるモデルを運用するラボが、すでに 6 つに増えています。Anthropic(Claude Fable 5, 60)、OpenAI(GPT-5.6 Sol max, 59)、Moonshot AI(Kimi K3, 57)、SpaceXAI(Grok 4.5 high, 54)、Z AI(GLM-5.2 max, 51)、そして Meta(Muse Spark 1.1 xhigh, 51)です。矢印は過去 8 日間に登場した 6 つのモデルを示しています。

長期的な視点で見ると、ここ 6 週間の状況がいかに異例かがわかります。2022 年後半以降の期間のほとんどでは、知能指数の最上位は一度に 1〜2 のラボが占めていました。しかし 6 月初旬からは、SpaceXAI、Moonshot AI、Meta、Z AI がすべてトップと 10 点以内の差まで迫っています。

今回の一連のモデル発表は、Artificial Analysis のコーディングエージェント指数も大きく変えました。Codex における GPT-5.6 Sol(max)が 80 で首位に立ちます。これに次ぐのは Codex の GPT-5.6 Terra(max, 77)と、Claude Code の Claude Fable 5(max、フォールバックあり, 77)です。Grok Build の Grok 4.5(high)は 76 で、Codex の GPT-5.5(xhigh)と同点です。また、Opencode の Muse Spark 1.1(xhigh)が 69 で新規参入しました。

8 日間で、性能とコストの境界線が書き換えられました。GPT-5.6 Luna(max、0.21 ドル)、Muse Spark 1.1(xhigh、0.26 ドル)、Grok 4.5(high、0.31 ドル)はすべて、先週 GLM-5.2 が設定した価格(max、0.32 ドル)と同額かそれ以下です。一方、Kimi K3(0.94 ドル)と GPT-5.6 Sol(max、1.04 ドル)は、Claude Fable 5(2.75 ドル)のスコアからそれぞれ 3 ポイント、1 ポイント以内の性能を発揮しながら、タスクあたりのコストは約 3 分の 1 で提供されています。
詳細と完全な結果については、こちらをご覧ください:https://artificialanalysis.ai/models
原文を表示
The frontier has opened up: four frontier launches in eight days - Grok 4.5, GPT-5.6, Muse Spark 1.1, and Kimi K3. Six labs now have a model scoring above 50 on the Artificial Analysis Intelligence Index, up from two in early June
SpaceXAI's Grok 4.5 (high, 54) landed July 8. OpenAI's GPT-5.6 Sol, Terra, and Luna (max, scoring 59, 55, and 51) and Meta's Muse Spark 1.1 (xhigh, 51) followed within two days, and Moonshot AI's Kimi K3 launched July 16 at 57 - third overall, ahead of Claude Opus 4.8 (max, 56).
The top three models on the Index now come from three different labs and span just three points. Four of the ten highest-scoring models launched since July 8, and six of ten since early June.
The one thing that did not move is #1: Claude Fable 5 (60) has held the top spot since June 9, but its lead has narrowed from four points to one, and the price of the intelligence beneath it has collapsed.
Congratulations to the teams at SpaceXAI, OpenAI, Meta, and Moonshot AI on a remarkable eight days.
要点
➤ The frontier went from two labs to six in six weeks. Until June, only Anthropic and OpenAI had fielded a model at 51 or above on the Intelligence Index. GLM-5.2 (max, 51) brought Z AI onto the frontier in mid-June; last week added SpaceXAI with Grok 4.5 (high, 54) and Meta with Muse Spark 1.1 (xhigh, 51); Kimi K3 makes Moonshot AI the sixth, entering at 57.
➤ Kimi K3 debuts at #3 with agentic and knowledge work scores behind only the top two. Kimi K3 scores 1668 Elo on GDPval-AA v2, third behind Claude Fable 5 (max, 1760) and GPT-5.6 Sol (max, 1748). On AA-Briefcase, our private benchmark of long-horizon knowledge work, it enters at #2 with 1547 Elo - behind only Claude Fable 5 (max, 1583) and ahead of GPT-5.6 Sol (max, 1495) - with an Analytical Quality Elo (1760) effectively tied with Fable 5 (1764). At $0.94 per Intelligence Index task on its $3/$15 per 1M input/output token pricing, it delivers comparable intelligence to Claude Opus 4.8 (max, $1.80) at roughly half the cost per task.
➤ Near-frontier intelligence got 2-3x cheaper in eight days. GPT-5.6 Sol (max) delivers one point below Claude Fable 5 (max) at $1.04 per Intelligence Index task versus $2.75. Grok 4.5 (high) delivers 54 at $0.31, under a third of GPT-5.5 (xhigh, $0.99). At 51, GPT-5.6 Luna (max, $0.21) and Muse Spark 1.1 (xhigh, $0.26) undercut GLM-5.2 (max, $0.32), the cheapest model at that intelligence level just a week earlier.

Six labs now field a model above 50 on the Artificial Analysis Intelligence Index: Anthropic (Claude Fable 5, 60), OpenAI (GPT-5.6 Sol, max, 59), Moonshot AI (Kimi K3, 57), SpaceXAI (Grok 4.5, high, 54), Z AI (GLM-5.2, max, 51), and Meta (Muse Spark 1.1, xhigh, 51). Arrows mark the six entries from the past eight days.

The long view shows how unusual the past six weeks have been. For most of the period since late 2022, the frontier of the Intelligence Index was held by one or two labs at a time. Since early June, SpaceXAI, Moonshot AI, Meta, and Z AI have all closed to within single digits of #1.

The launches also reshaped the Artificial Analysis Coding Agent Index. GPT-5.6 Sol (max) in Codex now leads at 80, ahead of GPT-5.6 Terra (max, 77) in Codex and Claude Fable 5 (max, with fallback) in Claude Code (77). Grok 4.5 (high) in Grok Build scores 76, on par with GPT-5.5 (xhigh) in Codex, and Muse Spark 1.1 (xhigh) in Opencode enters at 69.

Eight days redrew the intelligence versus cost frontier. GPT-5.6 Luna (max, $0.21), Muse Spark 1.1 (xhigh, $0.26), and Grok 4.5 (high, $0.31) all sit at or below the price GLM-5.2 (max, $0.32) set a week earlier, while Kimi K3 ($0.94) and GPT-5.6 Sol (max, $1.04) deliver within three and one points of Claude Fable 5 ($2.75) at roughly a third of its cost per task.
For more details and full results see: https://artificialanalysis.ai/models
AI算出
主要ニュースainew評価標準
記事は特定の期間内に複数の新モデルが知能指数 50 を突破し、競合状況や価格構造が劇的に変化したことを具体的な数値(スコア、Elo、ドル単価)で報告しており、AI モデルの最新動向に関する一次情報としての価値が高い。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 25
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み