GPT-6 Astra、コーディングで Fable 5 に並ぶも価格高騰
本文の状態
日本語全文を表示中
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Artificial Analysis
GPT-6 Astra はコーディングで Fable 5 と同等だが、インテリジェンス指数でも GPT-5.6 Sol より少ないトークンを使用し、価格は 2.5 倍に上昇した。
AI深層分析を開く2026年9月4日 05:48
AI深層分析
キーポイント
コーディングエージェント指数での高評価
GPT-6 Astra は Artificial Analysis Coding Agent Index で Fable 5 と同等のスコアを達成し、コストは半分以下で実現している。
トークン効率の劇的な向上
GPT-5.6 Sol に比べて約 70% トークン効率が向上しており、最大努力レベルでも同程度のスコアを維持しながらコストを抑えている。
インテリジェンス指数での価格競争力低下
GPT-5.6 Sol と同等のインテリジェンススコア(61)だが、トークン効率の向上が相殺されるほどに価格が 2.5 倍に引き上げられた。
競合モデルとの比較状況
Codex ハーネスでは Claude Opus 5 や Muse Spark 1.3 と同等のスコアだが、Fable 5.1 がわずかに上回る最高スコアを記録している。
知能指数とコストのトレードオフ
GPT-6 Astra は GPT-5.6 Sol と同等の知能指数を獲得したが、出力トークン数は約10%減少し、価格が2.5倍になったため、最大努力時のタスクあたりの費用は75%増加した。
重要な引用
GPT-6 Astra makes significant gains in the Artificial Analysis Coding Agent Index, scoring equal to Fable 5 at lower cost.
Pricing is 2.5x GPT-5.6 Sol's current prices across the board, up from $4/$20 to $10/$50 per million input/output tokens
GPT-6 Astra sees a substantial improvement in token efficiency, using one third of the tokens compared to GPT-5.6 Sol (max)
GPT-6 Astra defines a new Pareto frontier for Intelligence Index vs Output Tokens per Task
編集コメントを表示
編集コメント
GPT-6 Astra の登場は、コーディングタスクにおけるコスト効率の新たな基準を示すものであり、開発現場でのモデル選定戦略に直接的な影響を与える。ただしインテリジェンス分野では価格上昇が課題となるため、用途に応じた使い分けが求められる局面である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
GPT-6 Astra は Artificial Analysis のコーディングエージェントインデックスで大幅な進歩を遂げ、Fable 5 と同等のスコアをより低いコストで達成しました。知能指数では GPT-5.6 Sol より少ないトークン数で同程度の性能を発揮しますが、価格の高さがそれを上回ります。

価格は全体的に GPT-5.6 Sol の現在の価格の 2.5 倍となり、入力・出力トークン 100 万あたりが従来の 4 ドル/20 ドルから 10 ドル/50 ドルへ引き上げられました。キャッシュ読み取りには引き続き 90% の割引、キャッシュ書き込みには 25% の上乗せが適用されます。
我々の 2 つの主要インデックスではそれぞれ異なる結果が見られます。Artificial Analysis コーディングエージェントインデックスでは、GPT-6 Astra はトークン効率の大幅な向上により、Fable 5 よりも半額以下のコストで同等のスコアを記録しました。一方、Artificial Analysis 知能指数では GPT-6 Astra は同程度の性能を発揮する上で前世代よりも効率的ですが、価格上昇がそのメリットを相殺しています。
Artificial Analysis コーディングエージェントインデックス - 主なポイント:
➤ 競合トップモデルとの比較: Codex では GPT-6 Astra はインデックスで 67 を記録し、Claude Code の Claude Opus 5 や Fable 5、Muse Code の Muse Spark 1.3 とほぼ同等です。Claude Code における Fable 5.1 がスコア 70 でインデックスをリードしています。
➤ GPT-5.6 Sol よりトークン効率が 70% 向上
GPT-6 Astra は、トークン効率において大幅な改善が見られます。Codex ハーネスでは GPT-5.6 Sol(最大設定)の約 3 分の 1 のトークン量で動作し、Claude Opus 5(xhigh)と比較してもその 5 分の 1 に抑えられています。モデルの処理レベルを変化させた場合でも、トークン効率のパレートフロンティア(最適解の集合)を維持しています。
➤ コーディングエージェントインデックスにおけるコスト効率の最前線をリード
最大設定では、GPT-6 Astra のコストは GPT-5.6 Sol(最大設定)とほぼ同等ですが、インデックススコアは 2 ポイント上回ります。タスクあたりのコストで見ると、同じスコアを達成する Claude Fable 5 の半分以下です。
Artificial Analysis Intelligence Index - 主なポイント:
➤ インテリジェンス指数では GPT-5.6 Sol に匹敵
GPT-6 Astra はインテリジェンス指数で 61 を記録し、GPT-5.6 Sol と同等のスコアを達成しました。これは Claude Fable 5.1(フォールバックありの最大設定)より 5 ポイント低く、またメタ社が新たに発表した Muse Spark 1.3(最大設定)にも及びません。
➤ 出力トークン数が約 10% 削減される一方、価格上昇も伴う
GPT-6 Astra は、インテリジェンス指数とタスクあたりの出力トーク数における新たなパレートフロンティアを確立しました。最大設定では GPT-5.6 Sol と比較してトークン使用量が約 10% 削減されています。しかし、価格が 2.5 倍に引き上げられたため、最大設定でのタスクあたりのコストは前世代モデルの 75% 増となっています。
➤ 幻覚発生率が GPT-5.6 Sol の半分以下に:GPT-6 Astra は、知識と幻覚を評価するベンチマーク「AA-Omniscience」で大幅な進歩を遂げました。最大努力時の幻覚発生率は 92% から 51% に劇的に低下したことが要因です。一部のモデルとは異なり、この精度向上は正確性を犠牲にして得られたものではありません。Astra は同時に精度も 4 ポイント向上させています。
➤ AA-Briefcase Elo で約 80 ポイントの向上:GPT-6 Astra は、最先端の長期知識作業を評価する「AA-Briefcase」で約 80 ポイントのスコアアップを記録しました。この評価では、複数の関連タスクと数千に及ぶソースファイルを含む数週間にわたるプロジェクトがモデルに課されます。Astra は前作と比較して、AA-Briefcase におけるルーブリックスコアと分析品質 Elo の両方で顕著な向上を示しています。一方で、プレゼンテーション品質 Elo では低下が見られ、この項目では依然として GPT-5.6 Sol(最大努力時)が全モデルをリードしています。
➤ 他の評価指標での成果は混在:数学、科学、人文系に重点を置いた長年の評価指標である「Humanity's Last Exam」では 6 ポイントの向上が見られました。しかし、44 の職業における経済的価値のあるタスクを測定するために OpenAI のデータセットを改変したベンチマーク「GDPval-AA v2」では約 80 Elo ポイントの低下が確認されています。また、顧客対応(τ³-Banking)、科学分野における Python 問題(SciCode)、大規模文書に対する長文脈推論(AA-LCR)など、多様な能力に関する他の評価項目でも 2〜3 ポイントの後退が見られました。

コーディングエージェントのインデックスにおけるコスト削減は、トークン効率の向上によって実現されています。最大限の努力を払った場合、GPT-5.6 Sol(Max)と比較してトークン使用量は約3分の1に抑えられています。

GPT-6 Astra は、コーディングエージェントインデックスとタスクあたりのコストを比較したパレートフロンティア上に位置しています。最大設定でのコストは GPT-5.6 Sol(最大)と同程度ですが、インデックススコアでは 2 ポイント上回っています。

GPT-6 Astra は、タスクあたりの出力トークン数に対するインテリジェンス指数の新たなパレートフロンティアを定義しました。最大負荷時における GPT-5.6 Sol と比較すると、出力トークンは約 10% 削減されています。

GPT-6 Astra は、最大負荷時の GPT-5.6 Sol と比較してコストが 75% 高くなっています。また、タスクあたりのコスト対知能指数のフロンティアにおいて、前作よりも大きく後退しています。この背景には価格が 2.5 倍に引き上げられた要因があり、トークン使用量の削減によって一部相殺されています。

GPT-6 Astra は、最大負荷時のハルシネーション(幻覚)発生率が 92% から 51% に大幅に低下したことで AA-Omniscience のスコアが大きく向上しました。これに伴い、精度もわずかに改善されています。

エージェントによる知識作業における進捗は混合した結果となりました。AA-Briefcase では約 80 ポイント向上しましたが、GDPval-AA v2 では同程度のスコア低下が見られました。AA-Briefcase においては、評価基準の得点と分析品質のエロ(Elo)が大幅に増加する一方、プレゼンテーション品質のエロは減少しています。

Artificial Analysis Intelligence Index v4.1.1 における個別評価の詳細内訳です。
GPT-6 Astra と他の主要モデルを比較するには、www.artificialanalysis.ai をご覧ください。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み