Artificial Analysis、知能指数インデックス v4.2 を発表し評価基準を強化
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
Artificial Analysis は業界の最前線への追従と評価のガバナンス強化を目的として、複雑なタスクや非公開テストセットを追加したインテリジェンス指数 v4.2 を即時リリースすると発表した。
AI深層分析を開く2026年9月5日 07:47
AI深層分析
キーポイント
AA-Briefcase の追加
業界専門家が構築した複雑なプロジェクトにおける多週間の知識作業タスクを評価する、非公開テストセットを持つエージェント型評価指標が新設された。
GDP.pdf による文書推論の強化
Surge AI が作成した GDP.pdf は、4,592 ページにわたる PDF ドキュメントからの証拠統合と専門的な文書推論能力を評価する新たな基準として導入された。
GPQA Diamond の削除
科学的推論評価の指標である GPQA Diamond は、現在飽和状態にあるため、指数から除外されることになった。
ガメング対策と加重比率の変更
テストセットの 40% を非公開の保持データに変更し、評価結果のゲーム化(gaming)を防ぐための重み付けを強化した。
評価の不正防止と加重比率の見直し
Index v4.2では、モデルが評価を操作するリスクを減らすため、非公開テストセットの重み付けを前バージョンから倍増させている。この手法は将来的にさらに強化される予定である。
重要な引用
Index v4.2 has more complex and realistic tasks, and more private test sets to prevent gaming
We have deliberately held back updates to keep the Index stable through recent major model launches.
With the frontier moving so quickly in the past weeks, we feel it is important to deliver an immediate interim update
"Anthropic's Claude Fable 5.1 leads the Index, followed by OpenAI's GPT-6 Astra, which shows a 4pt gain over GPT-5.6 Sol."
編集コメントを表示
編集コメント
評価指標の更新頻度が高まっている背景には、生成 AI モデルの進化速度が極めて速い現状がある。非公開テストセットの比率引き上げは、ベンチマークの信頼性を維持するための重要な対策と言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
次期リリース「v5」の要素を先行して加速し、最前線の動向に追いつくための中間アップデートを実施しました。Index v4.2 では、より複雑で現実的なタスクと、ゲーム対策のための非公開テストセットを追加しています。
Intelligence Index v4.2 の変更点:
+ AA-Briefcase: 非公開テストセットを備えた、エージェントによる知識作業の評価
+ Surge's GDP.pdf: 4,592 ページにわたる PDF ドキュメント全体を対象とした長文コンテキスト推論
- GPQA Diamond: すでに飽和状態となった、極めて高度な科学的推論評価
…さらに、ゲーム対策のために非公開テストセットの重み付けを強化し、堅牢性を高めるための採点インフラもアップグレードしました。
今回のアップデートにより、Index はより挑戦的で複雑、そして現実的なタスクと、不正行為を防ぐための非公開テストセットを通じて、実世界でのユースケースに近づきました。私たちは数ヶ月前から Index v5 の要素を計画・構築してきましたが、Index v4 を 1 月にリリースしてからすでに 8 ヶ月が経過しています。
直近の主要モデルの発表に伴い Index が安定した状態を保てるよう、意図的にアップデートを控えていました。しかし、ここ数週間で最前線の技術が急速に進化しているため、ユーザーにとって Index がこれまで通り関連性が高く有用であり続けるために、即座に中間アップデートを実施することが重要だと判断しました。
今回の中間アップデートに加え、チームは Index v5 の開発に全力で取り組んでいます。近々、さらに段階的なリリースを予定しています。続報をお楽しみに!
Intelligence Index v4.2 の詳細変更点:
Artificial Analysis Intelligence Index v4.2 の新機能
➤ AA-Briefcase の追加: 自社開発の評価セット「AA-Briefcase」は、業界の専門家が構築した複雑なプロジェクトにおける、現実的なエージェント型知識作業タスクをモデルにテストします。評価対象となるのは数週間にわたる知識作業プロジェクトで、それぞれ多数の関連タスクと数千ファイルの入力ソースが含まれます。AA-Briefcase はルールの適用とペア比較による採点を組み合わせ、検証可能なタスクの成功、分析の質、プレゼンの質を総合的に評価します。これにより、知識分野におけるエージェント全体の能力を多角的に把握できます。
➤ GDP.pdf の追加: Surge AI が作成した「GDP.pdf」は、100 件の PDF ドキュメントと 10 のドメインにわたる単発の専門文書推論を評価します。モデルはテキスト、表、チャート、脚注、除外事項などを含む 4,592 ページに分散した証拠を統合する必要があります。回答は 1,275 件の専門家作成の原子基準に対して採点され、「All-pass Rate(全項目合格率)」という指標では、すべての基準を満たした場合のみそのタスクが成功とみなされます。
➤ 実世界での利用状況の測定と評価の悪用防止のための加重調整: Index の加重配分において、40% を非公開の保持データセットに割り当てるようになりました。これは v4.1 の倍増です。保持データには AA-Briefcase、AA-Omniscience、CritPt 用のソリューションが含まれます。これにより、各ラボが評価を操作する可能性を大幅に低減します。Index v5 ではさらに保持データの割合を引き上げる予定です。
➤ 採点インフラの強化
AA-LCR v1.1 では、採点用のプロンプトを追加し、回答キーの誤りや曖昧さを修正することで、スコアリングの精度を向上させました。GDPval-AA v2 と AA-Briefcase については、サンプリング手法を見直し、Elo スケールを再設定したため、新モデルが追加されても評価が安定しています。SciCode では採点用サンドボックスの堅牢性を高め、実行に時間がかかっても正解であれば失敗として扱わないようにしました。
主な結果:
➤ 人工知能分析インデックスを Anthropic と OpenAI がリード
Anthropic の Claude Fable 5.1 がインデックス首位に立ち、OpenAI の GPT-6 Astra がそれに続きます。GPT-6 Astra は GPT-5.6 Sol を 4 ポイント上回っています。3 位は Meta で、その後に SpaceXAI、Moonshot/Kimi、Z.AI、Google と続きます。
➤ タスクあたりのコストにおけるパレートフロンティアを 4 ラボが共有
Anthropic、OpenAI、Meta、そして Z.AI が、更新されたタスクあたりのコストのパレートフロンティアを占めています。
➤ GPT-6 Astra が出力トークン効率で圧倒的
GPT-6 Astra は、知能のフロンティアに近いほぼすべてのモデルよりもトークン効率が優れています。この曲線の両端には Claude Fable 5.1、Grok 4.5、Gemini 3.5 Flash-Lite が位置しています(インデックス評価が 25 未満のモデルは除外)。

GPT-6 Astra は、知能のフロンティアに近いほぼすべてのモデルよりもトークン効率が優れています。この曲線の両端には Claude Fable 5.1、Grok 4.5、Gemini 3.5 Flash-Lite が位置しています(インデックス評価が 25 未満のモデルは除外)

Anthropic の Claude Fable 5.1 と Opus 5 が「AA-Briefcase」で首位に立ち、GPT-6 Astra や Muse Spark 1.3 に続く結果となりました。特に GPT-6 Astra は、GPT-5.6 Sol を約 85 Elo ポイント上回る大幅な進歩を示しています。
AA-Briefcase は、業界の専門家が構築した複雑なプロジェクトにおける現実的なエージェントによる知識作業タスクを評価するための、私的に保持されたテストセットを用いた独自評価です。モデルは数週間にわたる知識作業プロジェクトで評価され、それぞれ多数の関連するタスクと数千に及ぶ入力ソースファイルを含みます。AA-Briefcase は、ルーブリック(評価基準)とペア比較による採点を組み合わせ、検証可能なタスクの成功、分析の質、プレゼンテーションの質を評価します。これにより、知識作業における全体的なエージェント能力の全体像を把握することができます。

GDP.pdf では、OpenAI が GPT-6 Astra(33.2%)と GPT-5.6 Sol(28.2%)で首位を独占し、Claude Fable 5.1(26.2%)が続きます。
Surge AI によって作成された GDP.pdf は、10 のドメインにわたる 100 件の PDF を対象とした、単発の専門的な文書推論能力を評価します。モデルはテキスト、表、チャート、脚注、除外事項などを含む 4,592 ページに分散した証拠を統合する必要があります。回答は、1,275 の専門家によって作成された原子レベルの評価基準に対して採点されます。「オールパス率」という指標は、すべての基準が満たされた場合にのみタスク成功としてカウントされます。
各モデルの詳細な内訳は以下の通りです。



Artificial Analysis Intelligence Index v4.2 に関する詳細は、https://artificialanalysis.ai/methodology/intelligence-benchmarking をご覧ください。
同じ出来事を2媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み