GPT‑6 Astra、段階的展開と価格設定を発表
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Simon Willison Blog
OpenAI は新モデル GPT-6 Astra を限定組織向けにロールアウトし、セキュリティや長文処理で顕著な性能を発揮する一方、総合知能指数では競合に劣ることを発表した。
AI深層分析を開く2026年9月4日 05:55
AI深層分析
キーポイント
GPT-6 Astra の展開と価格設定
OpenAI は GPT-6 Astra を限定組織向けに本日ロールアウトし、今後数日で全 ChatGPT ユーザーおよび API/AWS 経由で利用可能にする。API 料金は Claude Fable 5 と同様の $10/百万入力、$50/百万出力に設定される。
ARC-AGI ベンチマークにおける特異な成績
Astra は ARC-AGI 3 で 99.9% のスコアを記録したが、これは OpenAI が独自に開発した「Provider Adapter harness」を使用した場合の結果であり、デフォルト設定では 62.7% に留まる。
セキュリティおよび長文処理能力の強化
Hugging Face のインシデントを踏まえ、Astra は ExploitBench で 100% を達成するなどのセキュリティタスクに優れ、256K〜512K トークン範囲で 100% の精度を示すなど長文処理能力も向上している。
総合知能指数での相対的評価
Artificial Analysis のインテリジェンス指数では GPT-5.6 Sol と同点だが Claude Fable 5.1 より低く、Meta の Muse Spark 1.3 にも劣る一方、コーディングエージェントの効率性では優位性を示す。
重要な引用
GPT-6 Astra scores 99.9% on the recent (released in March) ARC-AGI 3 benchmark - though notably Fable 5 does not yet have a published result, and the ARC-AGI blog notes that the 99.9% score was achieved for $19K using OpenAI's custom "Provider Adapter harness", while the default ARC-AGI harness scored 62.7% for $26K.
Astra is a beast at security tasks. It scores 100% on ExploitBench (GPT-5.6 Sol got 78.5%), 42.4% on ExploitGym (Sol got 30.3%), and 99.2% within four attempts on SRE-Bench binary reverse engineering compared to Sol's 68.7%.
Sits beside GPT-5.6 Sol in Intelligence: GPT-6 Astra scores equal to GPT-5.6 Sol in the Index at 61. This is 5 points lower than Claude Fable 5.1 (max with fallback).
編集コメントを表示
編集コメント
GPT-6 Astra の発表は、特定のベンチマークにおける高スコアが評価環境に依存する可能性を示唆しており、技術比較の複雑さを浮き彫りにしている。開発者は単なる数値だけでなく、評価条件やコスト効率性を多角的に検証する必要があるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
GPT‑6 Astra
GPT‑6 Astra は本日、限られた組織向けに展開を開始し、今後数日間で ChatGPT Plus、Pro、Business、Enterprise の全ユーザーおよび OpenAI API や AWS を通じて利用可能になります。私自身はまだ試していないため、現時点では詳細をお伝えできません。
API 料金は Claude 3.5 Sonnet と同様に、入力 100 万トークンあたり 10 ドル、出力 100 万トークンあたり 50 ドルで設定されます。これは明らかに OpenAI が Claude に対抗して打ち出したモデルであり、OpenAI が公表したベンチマークの多くで Claude より高いスコアを記録しています。
最も印象的なのは、今年 3 月に公開された ARC-AGI 3 ベンチマーク で 99.9% のスコアを達成したことです。ただし、Claude 3.5 Sonnet の公式結果はまだ発表されていません。また、ARC-AGI のブログ記事によると、この 99.9% というスコアは OpenAI が用意したカスタム「Provider Adapter harness」を使用し、19,000 ドルで達成されたものであり、デフォルトの ARC-AGI harness では 26,000 ドルをかけても 62.7% に留まりました。
Provider Adapter harness は、リクエスト間での非公開な推論状態を保持し、長い会話では圧縮技術を活用することで、モデルが過去の作業を再利用できるようにしています。
先述の Hugging Face の件を踏まえると、Astra がセキュリティタスクにおいて圧倒的な強さを示すのは当然の結果です。ExploitBench では 100% を達成(GPT-5.6 Sol は 78.5%)、ExploitGym でも 42.4%(Sol は 30.3%)を記録しました。また、SRE-Bench のバイナリ逆解析タスクでは、4 回の試行で 99.2% の成功率を達成しています。これに対し、Sol は 68.7% です。
長文コンテキストの処理においても、Astra はより優れています。OpenAI が実施した「8 つの針」ベンチマークでは、トークン数 256K〜512K で 100%、512K〜1M の範囲でも 96.3% を達成しました。これにより、長文処理における課題の一つを OpenAI が解決した可能性があります。
ただし、Astra はすべての分野で勝っているわけではありません。Artificial Analysis は、知能指数(Intelligence Index)において Astra が Fable に劣っていると指摘しています:
GPT-5.6 Sol と並ぶ知能: GPT-6 Astra の知能指数は 61 で、GPT-5.6 Sol と同等です。これは Claude Fable 5.1(フォールバックありの最大値)より 5 ポイント低く、Meta が新たにリリースした Muse Spark 1.3(最大値)にも及びません。
一方、コーディングエージェント指数では優れた結果を残しています:
コーディングエージェント指数のコスト効率フロンティアをリード: 最大努力時、GPT-6 Astra のコストは GPT-5.6 Sol(最大値)とほぼ同等ですが、指数スコアは 2 ポイント上回っています。タスクあたりのコストで見ると、同じスコアを得るための Claude Fable 5 の半額以下です。
Astra へのアクセス権が得られ次第、さらに詳しく記事を書きます。公開された際の API モデル名は gpt-6-astra です。
Via Hacker News
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み