Artificial Analysis、Kimi K3 が Fable 5 に次ぐ評価と報告
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Artificial Analysis
Kimi K3 はエージェント型知識作業を評価する独自ベンチ「AA-Briefcase」で Elo 1543 を記録し、Claude Fable 5 に次ぐ第2位の成績を収めた。
AI深層分析を開く2026年8月1日 14:01
AI深層分析
キーポイント
AA-Briefcase ベンチマークでの高スコア達成
Kimi K3 はエージェント型知識作業を評価する独自ベンチ「AA-Briefcase」で Elo 1543 を記録し、Claude Fable 5 に次ぐ第2位の成績を収めた。
前世代モデルからの劇的な性能向上
Kimi K3 は先行する Kimi K2.6 と比較して Elo で +727 の大幅な改善を示し、GPT-5.6 Sol や Claude Sonnet 5 などの主要競合モデルを凌駕した。
コストと処理時間の課題
高い性能スコアを獲得する一方で、Opus 4.8 よりも実行コストが高く、タスクあたりの平均処理時間が約1時間かかるという非効率性が指摘されている。
分析性能は高いがプレゼンテーションは劣る
Kimi K3 は AA-Briefcase で Fable 5 に次ぐ 2 位となる分析品質 Elo 1754 を記録したが、プレゼンテーションの Elo は他モデルより低い。
タスクあたりのコストが約 10 倍に増加
Kimi K3 のタスク平均コストは 10.57 ドルで、トークン価格と平均 83 ターンという高いターン数により高騰している。
重要な引用
Kimi K3 is second only to Fable 5 on AA-Briefcase
scores an Elo of 1543, a +727 improvement over Kimi K2.6
costs more than Opus 4.8 to run while averaging nearly an hour per task
Kimi K3 achieves a rubric pass rate of 51%, second only to Claude Fable 5 (56%) and ahead of Claude Sonnet 5 (max, 42.3%) and GPT-5.6 Sol (max, 41.8%).
編集コメントを表示
編集コメント
Kimi K3 の登場は、中国発の AI モデルが特定のタスク領域で世界トップレベルに到達したことを示す重要な事例である。ただし、高いスコアを達成する一方でコストと速度という実用面での課題も浮き彫りになったため、現場での導入判断には慎重な比較検討が必要となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
モデルページはこちら:https://artificialanalysis.ai/models/kimi-k3
Kimi K3 は、エージェントによる知識作業を評価するベンチマーク「AA-Briefcase」において、Fable 5 に次ぐ第2位を記録しました。ただし、1 タスクあたりの平均処理時間が約1時間に達し、Opus 4.8 を実行するコストよりも高くなっています。
先週、Moonshot AI の Kimi が「Kimi K3」を発表しました。このモデルはパラメータ数が2.8Tで、Artificial Analysis Intelligence Index では57点を獲得しています。これは Opus 4.8 や GPT-5.5 と同等の性能です。AA-Briefcase では Elo 1543 を記録し、前世代の Kimi K2.6 よりも +727 の大幅な向上を達成しました。このスコアは Fable 5(1574)に次ぐ歴代2位の成績です。
AA-Briefcase は、エージェントによる知識作業を評価するために新たに作成した独自ベンチマークです。数千もの複雑な入力ファイルを含む、完全非公開のリアルタスクデータセットを用いてモデルを検証します。提出物にはスプレッドシートやプレゼン資料、UI のモックアップなどが含まれ、正答率、分析の質、プレゼンの質を総合して単一の AA-Briefcase Elo として算出されます。

Kimi K3 の AA-Briefcase における主要な結果:
➤ Fable 5 に次ぐ第2位: Kimi K3 は Elo 1543 を記録し、総合スコアで第2位となりました。これは GPT-5.6 Sol(最大値1501)、Claude Sonnet 5(最大値1388)、Claude Opus 4.8(最大値1347)を上回る成績です。前世代の Kimi K2.6(スコア816)と比較して +727 の向上を遂げ、Fable 5 に次ぐ位置に留まりました。

➤ 客観性と分析力は強みだが、プレゼンテーションは相対的に劣る: Kimi K3 は AA-Briefcase ベンチマークで 51% の合格率を記録し、Claude Fable 5(56%)に次ぐ第 2 位となりました。これは Claude Sonnet 5(最大値 42.3%)や GPT-5.6 Sol(最大値 41.8%)を上回る結果です。分析品質における Elo スコアは 1754 で、Claude Fable 5 の 1744 とほぼ同等の水準にあります。一方、プレゼンテーションの質は相対的に弱く、Elo スコアは 1471 です。これは GPT-5.6 Sol(最大値 1660)や Claude Opus 4.8(最大値 1492)を下回っています。

➤ 1 つのタスクあたりのコストが約 10 倍に増加: Kimi K3 の 1 タスクあたりの平均コストは 10.57 ドルで、AA-Briefcase ベンチマークにおいて最も実行コストが高いモデルの一つとなっています。この高コストの原因は、トークン価格の高さに加え、出力トークンの増加と、タスクあたりに必要なやり取り(ターン)の多さにあります。Kimi K3 は 1 タスクあたり平均 83 トーンを要しますが、Claude Fable 5 は 67、GPT-5.6 Sol は最大値で 50 です。料金体系は入力・出力ともに 100 万トークンあたり 3 ドル/15 ドルですが、キャッシュされたトークンには 90% の割引が適用されます。

➤ 1 タスクあたり平均約 1 時間: Kimi K3 の AA-Briefcase タスクあたりの所要時間は平均 56.4 分です。これは、ターン数が多いことに加え、公式の Kimi API を利用した際の出力トークン使用量の増加と処理速度の低下が要因となっています。Kimi K3 は 1 タスクあたり 120k トークンの出力と 83 ターンを要しますが、前世代の Kimi K2.6 ではそれぞれ 42k トークン、54 ターンでした。このタスクあたりの所要時間は AA-Briefcase で記録された中で最も高い水準の一つであり、Claude Fable 5 の約 2.5 倍、Grok 4.5 (高) の約 3.8 倍に達しています。
AA-Briefcase の完全な結果については、https://artificialanalysis.ai/evaluations/aa-briefcase をご覧ください。
原文を表示
Kimi K3 is second only to Fable 5 on AA-Briefcase, our agentic knowledge work benchmark, but costs more than Opus 4.8 to run while averaging nearly an hour per task
Last week Kimi (Moonshot AI) released Kimi K3, a 2.8T parameter model that scores 57 on the Artificial Analysis Intelligence Index, comparable to models such as Opus 4.8 and GPT-5.5. On AA-Briefcase, Kimi K3 scores an Elo of 1543, a +727 improvement over Kimi K2.6 and the second highest score recorded, behind only Claude Fable 5 (1574)
AA-Briefcase is our new proprietary benchmark for agentic knowledge work, testing models on a fully private dataset of realistic tasks across thousands of complex input files. Tasks require deliverables such as spreadsheets, presentations, and UI mock-ups, with performance combined into a single AA-Briefcase Elo based on correctness, analytical quality, and presentation quality

Key results for Kimi K3 on AA-Briefcase:
➤ Second only to Fable 5: Kimi K3 achieves an AA-Briefcase Elo of 1543, the second-highest score overall, ahead of GPT-5.6 Sol (max, 1501), Claude Sonnet 5 (max, 1388), and Claude Opus 4.8 (max, 1347). This is a +727 improvement over the previous-generation Kimi K2.6 (816) and puts Kimi K3 only behind Fable 5

➤ Strong objective and analytical performance, with comparatively weaker presentation: Kimi K3 achieves a rubric pass rate of 51%, second only to Claude Fable 5 (56%) and ahead of Claude Sonnet 5 (max, 42.3%) and GPT-5.6 Sol (max, 41.8%). It also records an analytical quality Elo of 1754, comparable to Claude Fable 5 (1744). Presentation quality is comparatively weaker, with a Presentation Elo of 1471, below GPT-5.6 Sol (max, 1660) and Claude Opus 4.8 (max, 1492)

➤ ~10x increase in Cost per Task: Kimi K3 averages a cost of $10.57 per task, placing it among the most expensive models to run on AA-Briefcase. This is driven by model token pricing, increased output tokens and relatively high turn use, averaging 83 turns per task, versus 67 for Claude Fable 5 and 50 for GPT-5.6 Sol (max). Kimi K3 is priced at $3/$15 per 1M input/output tokens, with a 90% discount for cached tokens

➤ Averages nearly an hour per task: Kimi K3 has an average Time per AA-Briefcase Task of 56.4 minutes. This is driven by a high number of turns, as well as higher output token use and lower speeds using the first party Kimi API. Kimi K3 uses 120k output tokens per task and 83 turns per task, up from 42k output tokens and 54 turns with Kimi K2.6. This average Time per Task is one of the highest recorded on AA-Briefcase, ~2.5x that of Claude Fable 5 and ~3.8x higher that of Grok 4.5 (high)
For full AA-Briefcase results, see https://artificialanalysis.ai/evaluations/aa-briefcase
AI算出
主要ニュースainew評価標準
記事は Moonshot AI の新モデル「Kimi K3」が Artificial Analysis の独自ベンチで Fable 5 に次ぐ第2位を獲得したという具体的な数値データと、コストや分析品質に関する詳細な分析を提供しており、AI モデルの性能評価という明確な主題を持つ。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 25
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み