Kimi K3、人工知能指数で GPT-5.5 と同等の第 3 位
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Artificial Analysis
Artificial Analysis の知能指数で Kimi K3 が GPT-5.5 や Opus 4.8 に匹敵し第 3 位を獲得した。
AI深層分析を開く2026年8月1日 14:03
AI深層分析
キーポイント
知能指数と他社モデルとの比較
Kimi K3 は Artificial Analysis Intelligence Index で 57 点を獲得し、Claude Opus 4.8 や GPT-5.5 と同等の性能を示すが、Claude Fable 5 や GPT-5.6 Sol には及ばない。
エージェントタスクでの卓越したパフォーマンス
GDPval-AA v2 で Elo 1668 を記録し K2.6 から大幅に向上し、Claude Fable 5 に次ぐ第 2 位を達成。また AutomationBench-AA では 53% のスコアで首位を獲得した。
オープンウェイトモデルとしての将来性
Moonshot AI は Kimi K3 の重み公開を表明しており、2.8T パラメータ規模が実現すれば GLM-5.2 や DeepSeek v4 Pro を引き離し、現在のオープンウェイトモデル群を圧倒する。
コスト効率とトークン利用の改善
タスクあたりのコストは GPT-5.6 Sol と同等だが Opus 4.8 より安価であり、K2.6 に比べて出力トークン使用量が 21% 削減されるなど、トークン効率も向上している。
ネイティブ多機能入力の対応
Kimi K3 は画像とテキストの両方を入力として受け付けるネイティブ多機能モデルとしてリリースされた。重みが公開されれば、多機能入力に対応する主要なオープンウェイトモデルの一つとなる可能性がある。
重要な引用
Moonshot AI has expressed plans to release the 2.8T parameter model's weights, which would make it the leading open weights model
Kimi K3 reaches an Elo rating of 1668 on GDPval-AA v2... surpassing GLM-5.2 (1514), GPT-5.5 (1494), and Claude Opus 4.8 (1600)
Once available, Kimi K3 would clearly lead other open weights models including GLM-5.2 (51) and DeepSeek v4 Pro (44)
Kimi K3, like K2.6, is released with native image and text multimodal input.
編集コメントを表示
編集コメント
Kimi K3 の性能はクローズドモデルの最上位層に迫るものがあり、重み公開が実現すればオープンソースコミュニティにおける開発の加速が期待される。ただし、2.8T という巨大なパラメータ規模を扱うには相当な計算リソースが必要となるため、実装環境の選定には注意が必要である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Kimi K3 は Artificial Analysis の知能指数で 57 点を記録しました。このスコアは Opus 4.8 や GPT-5.5 と同等の水準ですが、Fable 5 や GPT-5.6 Sol には及びません。Moonshot AI は、2.8T パラメータを持つ同モデルの重み(weights)を公開する計画を示しており、これが実現すれば最上位のオープンウェイトモデルとなります。
主な結果:
➤ エージェントタスクでの強力なパフォーマンス: Kimi K3 は GDPval-AA v2 で Elo レート 1668 を達成しました。これは K2.6 の 1190 から大幅に向上し、GLM-5.2(1514)、GPT-5.5(1494)、Claude Opus 4.8(1600)を抜いています。ただし、Claude Fable 5(1760)にはまだ及びません。また、Zapier のエージェント型 SaaS ワークフロー評価をベースにした「AutomationBench-AA」では 53% という驚異的なスコアを記録し、首位を獲得しました。
➤ AA-Briefcase(エージェントによる知識作業)で第2位の性能: 私たちのプライベートな長期の知識作業評価において、Kimi K3 は総合 Elo 1547 を達成し、Kimi K2.6 より +732 ポイント向上しました。Claude Fable 5 に次いで第2位です。バランスに優れており、ルーブリック評価と分析品質は Claude Fable 5 のスコアにほぼ匹敵します。一方、プレゼンテーションの質においては GPT-5.6 Sol が依然として他の主要モデルを上回っています。
「重み付けモデルの公開を待って、オープンウェイトモデルのトップに立つ」
Moonshot AI はまだ重み付け(weights)を公開していませんが、将来的な公開計画を示しています。公開され次第、Kimi K3 は GLM-5.2(スコア 51)や DeepSeek v4 Pro(スコア 44)といった他のオープンウェイトモデルを明確に上回るでしょう。ただし、パラメータ数が 2.8T と非常に大きく、GLM-5.2 の 753B や DeepSeek V4 Pro の 1.6T、そして Kimi K2 から K2.6 の 1T を含むオープンウェイトの競合モデルや、同社の既存モデルよりも遥かに大規模です。
「タスクあたりのコストは GPT-5.6 Sol と同等で、Opus 4.8 の約半分」
Kimi K3 のタスクあたりのコストは 0.94 ドルで、GPT-5.6 Sol(1.04 ドル)とほぼ同じ水準です。これは Opus 4.8(1.80 ドル)の約半額ですが、オープンウェイトモデルの競合よりも高い価格設定となっています。Moonshot AI の K3 の料金は、以前の K2 よりも大幅に引き上げられています。具体的には、K3 の出力トークン単価は 100 万トークンあたり 15 ドルに対し、K2.6 は 4 ドルでした。この価格設定により、Kimi K3 は Opus 4.8 よりもコストパフォーマンスが良く、GPT-5.6 Sol と同等ですが、GLM-5.2(0.32 ドル)や DeepSeek V4 Pro(0.04 ドル)といったオープンウェイトモデルよりは高価な位置づけになります。
「知能の向上とトークン効率の改善」
Kimi K3 は Artificial Analysis Intelligence Index におけるトークン使用量が大幅に減少し、K2.6 よりも出力トークンを 21% 削減しました。新しいモデルは、9 つの評価項目すべてを完了するために約 1.32 億個の出力トークンを使用しましたが、K2.6 は約 1.66 億個でした。これにより、より少ないリソースで高いスコアを達成しています。
ネイティブなマルチモーダル機能:Kimi K3 は K2.6 と同様に、画像とテキストの両方をネイティブに処理できるマルチモーダル入力に対応してリリースされました。もし重み(ウェイト)が公開されれば、Kimi K3 はマルチモーダル入力を備えた主要なオープンウェイトモデルの一つとして位置づけられるでしょう。
その他のモデル詳細:
コンテキストウィンドウ:100 万トークン
サイズ:総パラメータ数 2.8T
料金体系:公式 API の料金は、入力・出力ともに 100 万トークンあたり 3 ドル/15 ドルです。キャッシュされた入力は 90% オフとなり、100 万トークンあたり 0.3 ドルになります。
モダリティ:ネイティブなマルチモーダル入力ではテキストと画像に対応していますが、出力はテキストのみとなります。
アクセス方法:ローンチ時は Moonshot の公式 API を通じて利用可能です。モデルの重みはまだ公開されていませんが、Moonshot AI は今後公開する計画を持っていることを示しています。

新しい Kimi モデルは GDPval-AA v2 で ELO 1668 を記録し、実世界におけるエージェント性能の向上を示しました。

Kimi K3 は 1.32 億トークンの出力を使用し、K2.6 の 1.66 億トークンと比較して 21% 削減しながらも、インテリジェンス指数では 13 ポイントの向上を達成しました。

AA-Omniscience Index は +18 に改善され、K2.6 の +6 から大幅に上昇しました。これは精度率(33% から 46%)の向上によるものです。ただし、幻覚発生率は K2.6 より悪化し、39% から 51% に増加しています。

Kimi K3 のインテリジェンス・インデックスタスクあたりの平均コストは 0.94 ドルで、GPT-5.6 Sol(1.04 ドル)とほぼ同等です。これは Opus 4.8(1.80 ドル)の約半額の価格設定となっています。

各評価項目の詳細は以下の通りです。

Kimi K3 に関する追加分析については、Artificial Analysis をご覧ください:https://artificialanalysis.ai/models/kimi-k3
原文を表示
Kimi K3 scores 57 on the Artificial Analysis Intelligence Index. Its intelligence is comparable to Opus 4.8 and GPT-5.5 but remains behind Fable 5 and GPT-5.6 Sol. Moonshot AI has expressed plans to release the 2.8T parameter model's weights, which would make it the leading open weights model
Key results:
➤ Strong agentic task performance: Kimi K3 reaches an Elo rating of 1668 on GDPval-AA v2. This is a marked improvement over K2.6’s 1190, surpassing GLM-5.2 (1514), GPT-5.5 (1494), and Claude Opus 4.8 (1600). However, it still lags behind Claude Fable 5 (1760). Kimi K3 also scores an impressive 53% and takes the #1 position on AutomationBench-AA, our implementation of Zapier’s Agentic SaaS workflow evaluation.
➤ Second-highest performance on AA-Briefcase (agentic knowledge work): On our private long-horizon knowledge work evaluation, Kimi K3 reaches an overall Elo of 1547, +732 points from Kimi K2.6 and behind only Claude Fable 5. It is well-rounded: its rubric scoring and analytical quality almost reach Claude Fable 5’s scores, while GPT-5.6 Sol continues to outperform other leading models on presentation quality.
➤ Set to lead open weights models once weights are released: Moonshot AI has not yet released the weights but expressed plans to do so. Once available, Kimi K3 would clearly lead other open weights models including GLM-5.2 (51) and DeepSeek v4 Pro (44). However, at 2.8T parameters, it is significantly larger than its open weights peers (eg. GLM-5.2 at 753B params and DeepSeek V4 Pro at 1.6T), as well as the Kimi K2 to K2.6 models (1T params).
➤ Cost per task ($0.94) is similar to GPT-5.6 Sol ($1.04), ~1/2 the price of Opus 4.8 ($1.80) and higher than open weights peers: Moonshot AI’s pricing for K3 is significantly higher than their K2 pricing (K3’s output token price is $15/1M tokens while K2.6 was $4). This positions the model as cheaper on a cost per task basis than Opus 4.8, similar to GPT-5.6 Sol ($1.04) and more expensive than open weights peers, GLM-5.2 ($0.32) and DeepSeek V4 Pro ($0.04)
➤ Improved token efficiency alongside higher intelligence: Kimi K3’s token usage on the Artificial Analysis Intelligence Index decreased significantly, using 21% fewer output tokens than K2.6. The new model used approximately 132M output tokens to complete all nine evaluations, compared to approximately 166M for K2.6, while achieving higher scores.
➤ Native multimodal capabilities: Kimi K3, like K2.6, is released with native image and text multimodal input. If weights are released, this will position Kimi K3 as one of the leading open weights models with multimodal input capabilities
Other model details:
Context window: 1M
Size: 2.8T total parameters
Pricing: The first-party API is priced at $3.00/$15.00 per 1M input/output tokens, with cached input discounted 90% to $0.30 per 1M tokens.
Modality: Native multimodal input supports text and images, and the model remains text-only for output.
Accessibility: Accessible at launch through Moonshot’s first party API. Model weights are not yet released but Moonshot AI has expressed plans to do so.

The new Kimi model reaches 1668 in ELO on GDPval-AA v2, demonstrating improved real-world agentic performance.

Kimi K3 used 132M output tokens versus K2.6's 166M, a 21% reduction while achieving a 13-point Intelligence Index gain.

AA-Omniscience Index improved to +18, increasing from K2.6's +6. This is driven by improvements in accuracy rate (33% to 46%). However hallucination rate has regressed compared to K2.6, rising from 39% to 51%.

Kimi K3 costs an average of $0.94 per Intelligence Index task, which is similar to GPT-5.6 Sol ($1.04), ~1/2 the price of Opus 4.8 ($1.80)

Breakdown of individual evaluations:

Check out Artificial Analysis for additional analyses of Kimi K3: https://artificialanalysis.ai/models/kimi-k3
AI算出
主要ニュースainew評価標準
AI モデルの性能評価と市場動向に関する具体的な数値データを含む新規発表であり、検索意図が明確な特定モデル名が含まれている。日本企業との直接的な関連性は薄いものの、開発者にとって重要な技術指標となる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 25
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み