DeepSeek V4 Flash、人工知能指数で前モデルより10ポイント向上し50を記録
DeepSeek V4 Flash 0731 が Artificial Analysis のインテリジェンス指数で 50 を記録し、前世代より 10 ポイント向上してコスト効率とエージェント性能が大幅に改善された。
Artificial Analysis
ページを読み込み中…
Benchmark Radar
品質基準を通過評価機関とベンチマーク運営元の一次情報だけを収集し、直近30日の更新を日本語で整理します。 指標の前提が異なるため、別々のベンチマーク得点を単純に合算・平均化しません。
Last 30 Days
2026-07-02 以降
DeepSeek V4 Flash 0731 が Artificial Analysis のインテリジェンス指数で 50 を記録し、前世代より 10 ポイント向上してコスト効率とエージェント性能が大幅に改善された。
Artificial Analysis
Artificial Analysisの知能指数によると、インクリング・スモールはパラメータ数が同社の主力モデル「インクリング」の3 分の 1未満でありながら、その性能差がわずか 1 ポイント以内であることが示された。
Artificial Analysis
シンガポールのAIラボ、Agnes AI が推論モデル「Agnes 2.5 Pro Alpha」をリリースし、人工知能分析指数で39点を獲得しながらも低価格を実現した。
Artificial Analysis
MLCommons は AI インフラ調達を支援する新ベンチマーク「MLPerf Endpoints v0.7」を発表し、市場の最新動向に即した比較可能な評価基準の確立に向けた基盤整備を完了した。
MLCommons Inference
METR は、AI エージェントの意図違反事例を調査し、背後にある動機や訓練条件を理解するために、独立した研究者による体系的な第三者調査の枠組みを提案している。
METR
Artificial Analysis が発表したベンチマーク結果によると、Anthropic の Claude Opus 5 は「AA-Briefcase」で新リーダーとなり、競合モデルを凌駕する性能とコスト効率を実現した。
Artificial Analysis
Claude Opus 5 は Artificial Analysis のインテリジェンス指数で Fable 5 と同程度のスコアを獲得しつつ、タスクあたりの平均コストを約 26% 削減することに成功した。
Artificial Analysis
Scale Labs は、AI エージェントの能力をより厳密に評価するため、Terminal-Bench 3.0 を公開し、特に科学・金融・システム分野で難易度を大幅に引き上げている。
Scale Labs Blog
METRの研究者らは、AIが自己改良を加速させるメカニズムに関する経済モデルを提示し、データや計算リソースのボトルネックが存在する可能性を示しつつも、能力の急激な拡大を否定できないと結論付けた。
METR
Inkling は AA-Briefcase ベンチマークで Elo 836 を獲得し、DeepSeek V4 Flash よりも高いが、上位オープンモデルには及ばない。
Artificial Analysis
METR は AI エージェントの最適化能力を測定する「支出ハライズン」指標を提案し、NanoGPT の事例から人間と AI のコスト効率性が交差する予算点を算出した。
METR
Kimi K3 はエージェント型知識作業を評価する独自ベンチ「AA-Briefcase」で Elo 1543 を記録し、Claude Fable 5 に次ぐ第2位の成績を収めた。
Artificial Analysis
Google DeepMind は Gemini 3.6 Flash と Gemini 3.5 Flash-Lite をリリースし、タスクあたりの処理時間を半減させつつ、コスト効率を向上させた。
Artificial Analysis
Artificial Analysis の発表によると、過去8日間に4つの新モデルが投入され、知能指数50超のラボが2から6に増加し、トップ3のスコア差も縮小した。
Artificial Analysis
Artificial Analysis の知能指数で Kimi K3 が GPT-5.5 や Opus 4.8 に匹敵し第 3 位を獲得した。
Artificial Analysis
Thinking Machines が新モデル「Inkling」を公開し、人工知能指数で米国製オープンウェイトモデル首位となるなど、エージェント性能やマルチモーダル処理において顕著な成果を示した。
Artificial Analysis
Artificial Analysis の分析によると、GPT-5.6 Sol と Luna はコスト効率と知能の両面で Terra を上回り、特に Luna が最も効率的なモデルとして際立っている。
Artificial Analysis
Scale Labs はロボット学習データの品質管理において、単なる通過・不合格の判定ではなく、失敗要因を細分化し視覚的証拠を提示する測定パイプライン方式の有効性を示した。
Scale Labs Blog
MLCommons はエッジデバイス向けに、ツール呼び出しの精度と応答性を測定する新しいベンチマークを MLPerf Inference v6.1 に導入し、Qwen3.6-27B モデルを用いた実装例を示した。
MLCommons Inference
MLCommons は大規模言語モデルの生産環境における利用形態の変化に対応し、マルチターンなエージェント推論を評価対象に追加した新しいベンチマークを公開する。
MLCommons Inference
METR の Thomas Kwa は、Anthropic がコード生成量で8倍向上した事実を経済モデルに適用し、研究者の生産性向上率が少なくとも2倍以上であると推定する分析結果を発表した。
METR
Scale Labs は MCP と CLI の比較実験により、最新モデルではインターフェースの差が性能に与える影響は小さく、コストとレイテンシが主要な差異要因であると結論付けた。
Scale Labs Blog
ARC プライズ主催の ARC-AGI-3 評価基準において、人工知能の汎用性向上を目指すマイルストーン賞の第 1 号受賞者が発表された。
ARC Prize
起業家には技術的障壁除去による複雑なアプリ変換を、開発者には本番環境並みの持続的サンドボックスによるシームレスな構築・出荷を、AI モデルラボにはデータベース操作や複数ファイル生成といった高忠実度評価データをそれぞれ提供すると明記した。
Arena Blog
Arena AI は、LLM の出力が事実と一致する度合いを評価する「Factuality in the Arena」の指標を発表し、ハルシネーション対策におけるベンチマークの重要性を強調している。
Arena Blog