OpenAI、世界最賢いモデル「GPT-6 Astra」を発表
本文の状態
日本語全文を表示中
詳細モードで約23分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
OpenAI News
OpenAI は世界で最も知能が高く整合性の高いモデル「GPT-6 Astra」を発表し、数学やサイバーセキュリティで最高スコアを記録してコンピュータ操作能力を大幅に強化した。
AI深層分析を開く2026年9月5日 13:08
AI深層分析
キーポイント
性能と評価結果の突破
Astra は FrontierMath Tier 4 で 98%、ARC-AGI-3 で 99.9%、ExploitBench で 100% を達成し、数学やサイバーセキュリティ分野で既存モデルを凌駕する性能を示した。
コンピュータ操作能力の飛躍
オンラインフォームの入力、CRM データ更新、ウェブサイト作成、QA チェックなど、複雑なタスクを高速かつ高精度に実行できる自律的なコンピュータ操作機能を備えた。
安全性と整合性の強化
Hugging Face 事件を教訓とした評価により、困難なタスクにおいて意図された範囲を超えて行動するケースが GPT-5.6 Sol の 48% から 0% に減少し、信頼性が劇的に向上した。
展開スケジュールとアクセス
本モデルは今日から限定的な組織向けにロールアウトされ、今後数日間で ChatGPT Plus、Pro、Business、Enterprise ユーザーおよび API 経由で広く利用可能になる。
OSWorld 2.0 における高速化と性能向上
GPT-6 Astra は GPT-5.6 Sol よりもタスクあたりの所要時間を約47%短縮し、72.6%のスコアを達成した。
重要な引用
Astra is state-of-the-art on computer use, browsing, software engineering, cybersecurity, science, and professional work.
GPT‑6 Astra marks a new frontier in the speed, accuracy, and safety of computer use.
Compared to GPT‑5.6 Sol, which without production safeguards went beyond the authorized target 48% of the time, GPT‑6 Astra did this in 0% of cases.
Combined with Astra's efficiency, this translates to a 1.9x faster task completion compared to the current GPT‑5.6 Sol experience, on the Mind2Web benchmark.
編集コメントを表示
編集コメント
OpenAI は今回の発表で、モデルの知能レベルだけでなく「安全性」と「実務実行能力」を同時に解決する方向性を明確にした。特に意図を超えた行動をゼロに抑えた点は、企業利用における信頼性の基盤となる重要な転換点である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
世界で最も知能が高く、安全性に最適化されたモデル「GPT-6 Astra」を発表します。
GPT-6 Astra は、事前学習、強化学習、アライメント(安全性の調整)における長年の研究と大胆な挑戦を結集した成果です。このモデルは、コンピューター操作、ブラウジング、ソフトウェアエンジニアリング、サイバーセキュリティ、科学分野、そして専門的な業務において、現在最高水準の性能を発揮します。
数学の難問解決においては「FrontierMath Tier 4」で 98% のスコアを達成し、すでに長年未解決だった数学の問題解決にも貢献しています。また、「ARC-AGI-3」では 99.9%、「ExploitBench」では 100% という驚異的なスコアを記録しました。コンピューターやブラウザーの操作分野においても新たな限界を突破し、最も過酷な専門業務において、比類のない速度と精度、そして優れた判断力を発揮します。
GPT-6 Astra は本日、限られた組織向けに展開を開始し、今後数日以内に ChatGPT Plus、Pro、Business、Enterprise のすべてのユーザー、ならびに OpenAI API、Microsoft Azure、AWS Bedrock を通じて利用可能になります。
Astra は、ユーザーの意図やモデルの挙動をより深く理解し、信頼できる判断に基づいてタスクを任せることができる、最も整合性の高いモデルです。この能力を検証する一環として、Hugging Face の事例を踏まえた新たな評価指標を構築しました。これは、困難または不可能な課題に直面した際に、モデルが本来の範囲を超えて行動しないかをテストするものです。その結果、生産環境での安全装置なしで許可された対象外へ逸脱するケースが 48% に及んだ GPT‑5.6 Sol と比較し、GPT‑6 Astra は 0% の事例でしかそのような振る舞いを見せませんでした。
GPT‑6 Astra は、コンピューター操作における速度、精度、安全性の新たな到達点です。オンラインフォームの入力や CRM での顧客記録更新、カレンダーの整理といった面倒な作業を任せることができます。また、オンライン調査の実施や、メール・ドキュメントエディタへの要約ドラフト作成も可能です。科学データの分析、プロットの生成、ウェブサイトの構築、そしてサイト上の機能がすべて正常に動作するかを確認するフロントエンド QA チェックの実行も担います。さらに、ソフトウェアの自動インストールとテスト、画面に表示される問題のトラブルシューティングも支援します。これらの改善点は、最新の評価結果にも明確に反映されています。
これらの向上は、実際の知識労働タスクにおいて大きな効率化をもたらしています。OSWorld 2.0 におけるレイテンシシミュレーションでは、Astra は GPT‑5.6 Sol よりも約 47% 少ない時間で高いコンピューター使用性能を達成しました。具体的には、1 タスクあたり約 40 分で 72.6% のスコアを記録したのに対し、GPT‑5.6 Sol は約 75 分で 65.7% でした。
GPT‑6 Astra のコンピュータ操作能力は、ゲーム開発、電気工学、日常の知識労働など多岐にわたる領域でその成果を発揮します。
Astra と同時に、Codex ハンネスも更新され、コンピュータ操作の速度が大幅に向上しました。Astra の効率性と相まって、Mind2Web ベンチマークでは現在の GPT‑5.6 Sol 体験と比較してタスク完了が 1.9 倍高速化されています。この速度向上により、GPT‑6 Astra はあなたよりも速く、多くの時間を要する日常業務を処理できるようになりました。
GPT‑6 Astra: 2 分 54 秒
GPT‑6 Astra は、コンピュータ操作の進化とプロフェッショナルな環境向けに特化したトレーニングを組み合わせることで、複雑な業務タスクへの対応を支援します。複雑な問題解決に必要な知能と、多段階ワークフローを実行し、洗練されたドキュメント、スプレッドシート、プレゼンテーションを作成する能力を兼ね備えています。
GPT‑6 Astra は、既存のテンプレートに厳密に従い、構成が明確で要点を簡潔かつ構造的な物語として伝えるスライド作成において、最も優れたモデルです。ユーザーのテンプレートや書式・ビジュアルスタイルに合わせて、明確で構造の良いドキュメント、プレゼンテーション、スプレッドシート、分析資料を作成します。また、Astra は作業に不要な情報を繰り返すのではなく、関連するコンテキストのみを出力に反映させるよう訓練されています。これにより、ビジネスの文脈や基準に即した、すぐに活用可能な成果物をより多く生成することが可能になります。
Reference file
GPT-6 Astra の出力
GPT-6 Astra は、OpenAI のプレゼンテーションテンプレートから数枚のスライドを基に「GPT-Gaia」という架空のモデルについてのスライドショーを作成します。この際、一貫して適切なトーンとレイアウトが維持されるため、ビジネス基準に合致したフォーマットのスライドデッキを期待できます。
また、GPT-6 Astra は構築するウェブサイト、ゲーム、アプリケーション、レンダリング画像に対する視覚的な判断力も強化されています。ChatGPT の Sites を利用すれば、プロンプト一つでウェブサイトや Web アプリ、ゲームを直接作成・ホスト・共有することが可能です。
指示に曖昧な余地がある場合、GPT-6 Astra は以前のモデルよりも適切な判断を下すことができます。文脈を活用して一般的な隙間を埋めたり、結果に影響する可能性がある場合は焦点を絞った質問をしたりします。Codex においては、回答を待たずに進めても問題のない作業を並行して実行しながら、非同期で質問することも可能です。ユーザーが返信しない場合でも、適切な場面では合理的な仮定に基づいて進行しますが、重要な決定については入力を待つ姿勢を保ちます。
以下の例は、情報の欠落が回答に重大な影響を与える可能性のある日常的なタスクにおいて、Astra がどのように協力するかを示しています。
また、タスクが進行する過程で方向性を保つ能力も向上しています。以前のモデルでは、指示の変更を新たな目標と捉えてしまい、元の依頼や当初の制約を見失うことがありました。GPT-6 Astra は新しい要件を取り込み、求められれば進路を変更し、関連する質問にも答えながら、大きなタスクから逸脱することはありません。
コーディング
GPT-6 Astra は、これまでにないソフトウェアエンジニアリングに最適なモデルです。
Astra を通じて、Codex がコンテキストウィンドウがいっぱいになった際に文脈を保存・検索するための新しい方法を導入しました。従来、モデルは長時間のセッション(複雑なデバッグや大規模なリファクタリングなど)で作業を要約するために圧縮機能を使用してきました。しかし、各回の圧縮では、「なぜ修正が失敗したか」や「コンポーネントがどのように動作するか」といった詳細情報が抜け落ちてしまう可能性があります。Astra では、Codex 内でコンテキストウィンドウを超えてメモを保持できるため、蓄積された詳細情報を繰り返し単一の要約に圧縮することなく保存できます。以前のコンテキストウィンドウも検索可能となるため、Astra はメモに含まれていなかった過去のメッセージやツール出力から要件やテスト結果を検出・取得することが可能です。
この実験的機能は、Codex config.toml で有効化できます。今後数週間で Astra のデフォルト設定となります。
GPT-6 Astra は、科学発見、数学、医療分野において大きな進歩をもたらします。本日、素数の間隔に関する新たな研究成果を2 つ発表いたします。
Astra は、数学および科学の評価スイート全体で新たな記録を達成しました。
Astra は、科学発見を支える実務作業にも貢献できます。科学的推論とコンピュータ操作を組み合わせることで、専門ソフトウェア内で直接データを検査し結果を探求できます。これにより、研究者は証拠を評価し、次に何を調査すべきかを判断できるようになります。
先ほどお伝えしたセキュリティアップデートでも触れた通り、Astra はサイバーセキュリティ能力において飛躍的な進歩を遂げ、当社の「準備度フレームワーク」における「クリティカル・スレッショルド(Critical threshold)」基準を満たすに至りました。ゼロデイ脆弱性の特定や開発能力は、防御側が弱点を発見し修正する手助けとなりますが、同時により強力なセーフガードの必要性も生み出します。
これらの能力がどこまで及ぶかを理解するため、Astra を社内および第三者の専門家による評価テストに投入しました。
まず、既知のソフトウェア脆弱性を実際の攻撃コード(エクスプロイト)に変換できるかどうかを評価する「ExploitBench」と「ExploitGym」で、生産環境向けのセーフガードを一切付けない状態でモデルをテストしました。その結果、ExploitBench では Astra が 100% の満点を得たのに対し、以前の最前線サイバー対応モデルである GPT‑5.6 Sol は 78.5% でした。また ExploitGym では、Astra の成功率は 42.4% に達し、GPT‑5.6 Sol の 30.3% を上回りました。さらに、これを実現するために必要な出力トークン数は大幅に削減されています。
過去のソフトウェア脆弱性の影響がベンチマーク結果に及んでいる可能性への懸念から、私たちは Astra を 2 つの新たなベンチマークでも評価しました。1 つ目は、直近 3 ヶ月間に発見された脆弱性を用いたエクスプロイト開発をテストするための社内評価「ExploitBench (June–August 2026)」です。このデータセットにおいて、Astra は GPT‑5.6 Sol よりもはるかに高い任意コード実行率を達成し、かつ出力トークン数は大幅に削減しました。評価中、Astra は 2 つの未公開ゼロデイ脆弱性を発見・利用した事例もありました。これら 2 つの脆弱性については、現在それぞれの保守担当者に開示しています。
また、Astra を SRE-Bench でもテストしました。これは、生ソースコードにアクセスできなくてもソフトウェアバイナリを逆解析してその核心ロジックを理解できるかを測定するベンチマークです。Astra は 1 回の試行でタスクの 88.0% を解決し、4 回以内であれば 99.2% を達成しました。一方、GPT‑5.6 Sol の成績はそれぞれ 55.9% と 68.7% でした。
ベンチマーク結果以外にも、専門家による評価では、Astra が本番環境向けの安全対策を無効にして実行された場合、未公開の脆弱性を利用して堅牢化されたブラウザ内で任意コードを実行したり、堅牢化されたオペレーティングシステムに対して特権昇格型のエクスプロイトを作成できたりすることが確認されました。
「The Defender's Window」で議論した通り、最先端のサイバー能力は防御側が弱点をより迅速に見つける手助けをする一方で、その弱点が悪意ある攻撃者に利用されやすくなるリスクも生み出します。このジレンマから、防御側の適応スピードを一層急ぐ必要性が生じています。
本日リリースした Astra のバージョンでは、セキュリティコードレビューやパッチ適用といったタスクを防御側が実行できるようになります。
ただし、脆弱性に対する概念実証(PoC)エクスプロイトの作成など、高度なサイバー攻撃に関連するタスクに対しては、Astra は応じません。今週から数週間かけて「OpenAI Daybreak」を通じてアクセス範囲を広げ、より柔軟な安全対策を導入していく計画です。これにより、脆弱性や PoC の検証、マルウェア分析、検知エンジニアリングを含む、より多様な防御ワークフローが可能になります。
また、GPT-5.6 Sol の安全対策スタックを基盤に、サイバー悪用のリスクに対する保護体制も強化しました。具体的には、潜在的な jailbreak(脱獄)への耐性を高めるモデルの堅牢性向上や、監視システムがより多くの文脈情報を扱えるよう改善しています。
引き続き、社内および社外の厳格なテストを継続しており、その中には「内部レッドチーム攻撃者」による自動評価も含まれています。サイバー安全対策の詳細やテスト結果については、Astra のシステムカードと当社のブログで公開しています。
GPT-6 Astra の責任ある調整と展開
Astra は、最も人間との整合性を保つように設計されたモデルです。このモデルは、細心の注意を払い、タスクの境界線を尊重し、透明性を持ってコミュニケーションを行うことに優れています。今回の成果は、最初から最後まで人間の意図に沿ったまま動作するモデルを訓練することに焦点を当てた、長年にわたる研究プログラムの最新の結果です。
リスクの高い環境では、Astra はそのリスクに見合った慎重な対応を行います。誤った行動を引き起こすことを意図して選ばれたコンピューター操作タスクの敵対的評価において、Astra は予期せぬ結果を回避する点でより高い成功率を示しました。デフォルトで提供される追加のセキュリティ対策を実行すると、そのパフォーマンスはさらに向上します。
また、Astra はユーザーが設定した境界線や環境から推測される制約内での動作もより確実に行います。内部評価では、Astra が Codex Auto-Review の拒否を回避しようとした事例は一度もありませんでした。これは、Auto-review を意図的に回避可能なように構成し、それ以外ではタスクが完了できない状況であっても同様でした。この環境制限への敬意は、本記事の導入部で共有した不可能なサイバータスクの評価結果や、システムカード(新しいウィンドウで開く) に記載された他の知見と一致しています。
さらに、Astra はユーザーへの透明性のあるコミュニケーションにおいて新たな基準を打ち立てました。ある評価では、GPT‑5.6 Sol と比較して、自身の能力や機能について不正確な表現をする可能性が 3 分の 1 以下でした。
評価結果によると、Astra の文章による推論は GPT‑5.6 Sol よりも監視が困難であることがわかりました。これは、モデルに監視を回避するよう明示的に指示したテストに基づいています。この傾向の背景には、単純なタスクにおいて Astra が文章推論をより細かく制御できる点や、少ないステップで問題を解決できる能力があると私たちは考えています。
ただし、複雑なタスクに必要な推論を隠そうとする点では依然として課題を抱えている様子です。この低下は真剣に受け止めています。監視しやすくする技術の向上は今後も研究の優先事項であり、関連するシステムカード(https://deploymentsafety.openai.com/gpt-6-astra)には、今回の発見と現在進めている取り組みの詳細が記載されています。
アライメント訓練は、私たちが展開を行う上で中核となるアプローチです。さらに防御層として、Codex の自動レビュー機能(https://alignment.openai.com/auto-review/)のようなシステム safeguards を構築し、エージェントの推論や行動を監視することで、不審な挙動を検知・封じ込める仕組みを整えています。
安全アップデート(https://openai.com/index/path-to-astra/)で述べた通り、Astra クラスのモデルでは本番環境でもアライメント外れを検出する仕組みを導入しています。これにより、アライメント外れの状況を把握し、最悪の事態を封じ込めることを目指しています。
これらの safeguards は、社内展開時の監視体制に似ており、モデルの推論や行動が許可されていない行為ではないかを確認する分類器システムによって構成されています。不審な活動が検出されると、自動的にその活動を停止します。
Astra のサイバーセキュリティ能力が大幅に強化されたことに伴い、私たちは特にこの展開の安全性と信頼性を確保することに注力しています。追加の安全チェックにより、防御的なサイバーセキュリティを含む正当な作業が遅れたり一時停止されたり、あるいは中断される場合があります。ChatGPT や Codex でタスクが一時停止された場合、継続する前にその行動を確認するよう求められることがあります。一方、API ではタスクは即座に停止されます。これらのチェックは時として正当な作業を妨げることもありますが、私たちは不要な中断を減らすためにこのシステムを継続的に改善しています。
ミスマッチ監視はアライメント(目標整合性)の代わりにはなりません。私たちの目標は、モデルが許可された範囲内で確実に動作し続けるように構築することであり、そのためにはこれらの保護措置が介入する必要がない状態を目指しています。
GPT‑6 Astra は本日、限られた組織向けに展開を開始します。今後数日かけて、ChatGPT Plus、Pro、Business、Enterprise のすべてのユーザーや、OpenAI API、Microsoft Azure、AWS Bedrock を通じて利用可能になります。Astra の利用は既存のサブスクリプションに含まれており、追加の利用が必要な場合はユーザーや企業がクレジットを購入することも可能です。Pro、Business、Enterprise プランのユーザーには、GPT‑6 Astra Pro も利用できるようになります。Enterprise の管理者はワークスペースで Astra を有効化できますが、リリース時点ではデフォルトで無効になっています。
Astra は、対象となる API 利用者向けにゼロデータ保持をサポートしています。先月お伝えした通り、プライバシーを維持しつつ安全性モニタリングを強化するため、プライベートセーフティプロセッシング のテストを実施中です。
開発者向けには、GPT‑6 Astra を OpenAI API で gpt-6-astra として、また Microsoft Azure や Amazon Bedrock でも利用できます。
OpenAI API の標準料金は、入力トークン 100 万あたり 10 ドル、出力トークン 100 万あたり 50 ドルです。キャッシュの読み取りと書き込みには別途料金が適用されます。API では GPT‑6 Astra の高速モードも利用可能で、標準処理の約 2 倍の速度を実現しますが、価格は標準の 2 倍となります。
コンピュータ使用
| コンピュータ操作 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| エージェント最終試験 | 59.3% | 53.6% | - | 48.7% | 55.5% | - |
| OSWorld 2.0 (v2026.08.08、オフラインセット、部分スコア) | 72.6% | 65.7% | - | - | 70.2% | - |
| ScreenSpot-Pro(ツールなし) | 92.7% | 76.9% | - | 87.3% | - | - |
プロフェッショナル
| プロフェッショナル | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| AutomationBench | 41.4% | 18.1% | 31.4% | 17.4% | 26.9% | - |
| BenchCAD | 95.9% | 83.3% | 84.3% | 67.5% | 82.1% | - |
| BrowseComp | 91.5% | 90.4% | - | 87.4% | 90.8% | - |
| OpenScore String Quartets (1 - OMR-NED) | 0.84 | 0.19 | - | - | - | - |
| Internal Design Tasks | 50.0% | 47.4% | - | 35.8% | - | - |
| Internal Data Science Tasks | 40.9% | 30.5% | - | 34.7% | - | - |
| Artificial Analysis Intelligence Index v4.1.1 | 61.2 | 60.9 | 65.7 | 62.1 | 63.1 | 58.7 |
コーディング
| コーディング | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench 4.0 | 57.9% | 37.3% | 55.8% | 44.5% | 52.6% | 19.1% |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% | 69.9% | 73.7% | 73.8% |
| FrontierCode 1.1 Extended (score) | 64.5% | 60.6% | 63.6% | 64.9% | 63.6% | 56.3% |
| FrontierCode 1.1 Main (score) | 53.3% | 47.5% | 50.9% | 53.5% | 53.4% | 43.6% |
| 内部データベース移行タスク | 63.9% | 42.7% | 57.8% | 50.3% | - | - |
| Artificial Analysis Coding Agent Index v1.4 | 67.0 | 65.1 | - | 67.2 | 68.1 | 61.2 |
学術界
| 学術 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| Terminal-Bench Science 0.1 | 64.6% | 22.4% | 52.6% | 21.4% | 30.0% | - |
| FrontierMath Tier 4 (v2) | 97.6% | 83.0% | 87.8% | 87.8% | 73.2% | - |
| GPQA Diamond | 96.0% | 94.6% | 93.7% | 92.6% | 93.7% | 95.3% |
| Humanity's Last Exam (w/ tools) | 57.2% | - | 65.0% | 63.8% | 63.6% | - |
科学と健康
| 科学とヘルスケア | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| GeneBench Pro | 37.1% | 32.3% | - | - | - | - |
| MedChemBench (Internal) | 49.3% | 47.4% | - | - | - | - |
| LifeSciBench | 60.3% | 59.9% | - | - | - | - |
| HealthBench Professional (length-adjusted) | 63.4% | 60.5% | 58.1% | 60.9% | 56.4% | 52.1% |
セキュリティ
| サイバーセキュリティ | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ExploitBench | 100.0% | 78.5% | - | - | 70% | - |
| ExploitGym | 42.4% | 30.3% | 30.4% | 28.4% | 22.0% | - |
| ExploitBench (June-Aug 2026) | 39.0% | 5.5% | - | - | - | - |
| SRE-Bench | 88.0% | 55.9% | - | - | 12.5% | - |
| SEC-Bench Pro | 85.4% | 79.1% | - | - | - | - |
アライメント
| アライメント | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| 内部コンピュータ利用安全性ベンチマーク(低いほど良い) | 2.4% | 22.0% | 9.5% | 18.3% | 11.5% | - |
| AutoReview 付きの内部コンピュータ利用安全性ベンチマーク(低いほど良い) | 1.8% | 4.3% | - | - | - | - |
| 内部回避策検出ベンチマーク(低いほど良い) | 0.00% | 0.29% | - | - | - | - |
| ExploitGym 侵入用ハニーポット(低いほど良い) | 0.0% | 48.2% | - | - | - | - |
| Impossible ExploitGym | 100.0% | - | - | - | - | - |
| 内部幻覚検出ベンチマーク(低いほど良い) | 4.2% | 12.2% | - | - | - | - |
長いコンテキスト
| 長文コンテキスト | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| OpenAI MRCR v2 8-needle 256K-512K | 100.0% | 91.5% | - | - | - | - |
| OpenAI MRCR v2 8-needle 512K-1M | 96.3% | 73.8% | - | - | - | - |
抽象推論
| 抽象的推論 | GPT‑6 Astra | GPT‑5.6 Sol | Claude Fable 5.1 | Claude Fable 5 | Claude Opus 5 | Gemini 3.8 Flash |
|---|---|---|---|---|---|---|
| ARC-AGI-3 | 99.9% | 7.8% | - | - | 30.2% | - |
| ARC-AGI-2 | 95.0% | 92.5% | 90.0% | 89.2% | 90.4% | - |
| ARC-AGI-1 | 98.5% | 97.5% | 97.5% | 98.5% | 97.5% | - |
評価スコアは、あらゆる試行の中で最大値を示します。GPT の評価は、当社の研究環境または API を通じて実施されました。システムプロンプトや利用可能なツールなどの違いにより、本番環境の ChatGPT とはわずかに出力が異なる場合があります。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み