GPT-5.6:野心に応える最先端知能(19 分読了)
本文の状態
日本語全文を表示中
詳細モードで約27分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
OpenAI は新フラッグシップモデル「GPT-5.6 Sol」を含む GPT-5.6 ファミリーを一般提供開始し、エージェント評価やコスト効率で競合を凌駕する性能と、複数エージェントを協調させる新機能「ultra」を発表した。
AI深層分析を開く2026年8月2日 06:49
AI深層分析
キーポイント
GPT-5.6 ファミリーの一般提供開始
OpenAI は限定プレビューを経て、最上位モデルの Sol、バランス型の Terra、コスト効率重視の Luna からなる GPT-5.6 ファミリーを正式に一般提供した。
競合他社に対する性能とコストでの優位性
OpenAI によると、GPT-5.6 Sol は「Agents' Last Exam」で Claude Fable 5 を大幅に上回るスコアを記録し、同等の性能を実現する際の推定コストは競合の約 4 分の 1から 16 分の 1と低減した。
新機能「ultra」による複雑タスクの加速
OpenAI は最も要求の高い作業を加速する新設定「ultra」を導入し、複数のエージェントを並列ワークストリームで協調させることで複雑なタスクの完了時間を短縮した。
強化されたセーフティと評価体制
今回のリリースには過去最長の評価期間を経て導入された堅牢なセーフティが搭載され、悪意ある濫用への耐性を高めつつ正当な業務を制限しない設計となっている。
コーディング性能の大幅な向上と効率化
GPT-5.6 Sol は Artificial Analysis Coding Agent Index で新記録を樹立し、Fable 5 を上回る性能を発揮しながらも、出力トークン数や処理時間を半分以下に抑えている。
重要な引用
GPT‑5.6 Sol sets a new standard for both intelligence and efficiency, achieving state-of-the-art results across coding, knowledge work, cybersecurity, and science while outperforming previous and competing frontier models with fewer tokens and at lower estimated cost.
On Agents' Last Exam... GPT‑5.6 Sol sets a new high of 53.6, eclipsing Claude Fable 5 (adaptive reasoning) by 13.1 points.
ultra is our highest-capability setting, coordinating multiple agents across parallel workstreams to finish complex tasks faster.
GPT‑5.6 Sol is our best coding model yet.
編集コメントを表示
編集コメント
OpenAI が「Agents' Last Exam」で競合を大幅に引き離すスコアを記録した点は、実務におけるエージェント能力の基準が再定義される可能性を示唆している。コスト効率と処理速度の両立を実現する新機能「ultra」は、複雑な自動化タスクを実行する現場にとって大きな転換点となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、限定的なプレビュー に続き、GPT‑5.6 ファミリーを一般公開いたします。新フラッグシップモデルの Sol と、日常業務に適したバランス型の Terra、そして最もコスト効率に優れた Luna をご紹介します。
GPT‑5.6 Sol は、知能と効率性の両面で新たな基準を設定しました。コーディング、知識労働、サイバーセキュリティ、科学の各分野で最先端の結果を達成し、より少ないトークン数と推定コストで、以前のモデルや競合するフロンティアモデルを上回っています。その結果、ドルあたりのパフォーマンスが向上し、同じ予算でより多くの成果を生み出せるか、あるいは同等の結果をより低い総コストで実現できます。
また、最も要求の厳しい作業を加速するための新しい方法も導入しました。ultra は、複数のエージェントを並列のワークストリーム上で調整して複雑なタスクを高速に完了させるための最高性能設定です。コンピュータ操作能力とデザイン判断力の向上により、GPT‑5.6 Sol はこれまでで最も洗練されたコラボレーターとなり、結果を検証し、改良を加え、すぐに使える形で提供できるようになりました。
私たちは、GPT-5.6 を開発し、トークンごとにさらに有益な成果を引き出せるようにしました。55 の分野にわたる長期的な専門ワークフローを評価する「Agents' Last Exam」において、GPT-5.6 Sol は 53.6 という新記録を達成し、適応的推論機能を持つ Claude Fable 5 を 13.1 ポイント上回りました。中程度の推論レベルでも、GPT-5.6 Sol は Fable 5 を 11.4 ポイント引き離すだけでなく、推定コストは約 4 分の 1で済みます。この効率性は、より安価で普及した知能を実現するために不可欠な小型モデルにも及んでいます。GPT-5.6 Terra と GPT-5.6 Luna は、Fable 5 を上回る性能を、コストの約 16 分の 1 で実現しています。
また、「Artificial Analysis Intelligence Index」では、エージェント作業、コーディング、科学的推論、そして一般的な能力にわたる広範な知能指標において、最大推論モードの GPT-5.6 Sol は Fable 5 に僅か 1 ポイント差まで迫りながら、所要時間を 61% 短縮し、コストは約半分ですみます。
GPT-5.6 は、これまでにない堅牢なセーフガードを備えて登場しました。これは、意図的かつ適応的な悪用に対して耐性を持ちつつ、正当な作業を不必要に制限しないように設計されています。
一般提供に先立ち、私たちはモデルとセーフガードをこれまでで最も広範な評価期間にかけました。これには、人間のレッドチームによるテストと大規模な自動テストを組み合わせています。プレビュー期間中は、専門機関や信頼できるパートナーと緊密に連携し、より広い展開前に防御体制の圧力テストを行い、セーフガードを強化しました。
その結果生まれたシステムでは、モデルに組み込まれた保護層に加え、リアルタイムチェック、モニタリング、そして信頼度とリスクに応じて調整されたアクセス制御が統合されています。
GPT-5.6 Sol は、これまでにない最良のコーディングモデルです。Artificial Analysis Coding Agent Index において、最大推論モードの GPT-5.6 Sol が 80 のスコアを記録し、新たな最高記録を樹立しました。これは Fable 5 を 2.8 ポイント上回る結果です。しかも、出力トークン数は半分未満、所要時間は半分以下、コストは約 3 分の 1 で達成しています。
この優位性はシリーズ全体に広がっています。Terra は Fable 5 よりわずかに高く、Luna は Opus 4.8 を上回ります。どちらも、所要時間を約 3 分の 1 に抑え、出力トークン数を半分程度にし、推定コストを約 4 分の 1 に抑えながら達成しています。
また、複雑なコマンドラインワークフローや実コードベースにおける長期にわたるエンジニアリングタスクをテストする Terminal-Bench 2.1 や DeepSWE でも、新たな最高記録を樹立しました。
人工知能分析コーディングエージェントインデックス:実装、ターミナル利用、実際のコードベースにわたるコーディングエージェントのパフォーマンスを測定する独立した指標。
GPT‑5.6 は、ツールを調整し、中間結果を処理し、進捗状況を確認し、作業が進行するにつれて次のアクションを選択するような軽量プログラムを作成して実行できます。これにより、ツール依存度の高いタスクでも、必要なトークン数やモデルとの往復回数を減らし、より少ない指示で進められるようになります。開発者がすべての手順をスクリプト化したり、ツールの応答をすべてモデルに返却したりする必要はなく、Responses API の「プログラムmatic ツール呼び出し」機能を使えば、大量の中間データをフィルタリングして必要な情報だけを残し、その過程でワークフロー自体も適応させることが可能です。
時間と計算リソースの投入に見合う成果が得られる課題に対しては、GPT-5.6 は効率的なデフォルト設定を超えて性能を発揮します。max パラメータを指定すると、xhigh よりもさらに長い時間を確保できるため、推論や代替案の検討、チェックの実行、アプローチの見直しをより深く行うことができます。一方、ultra はデフォルトで 4 つのエージェントを並列に協調させることで、トークン使用量を増やす代わりに、より強力な結果と、困難なタスクにおける結果到達までの時間を短縮します。
以下のチャートは、BrowseComp、SEC-Bench Pro、Terminal-Bench 2.1 の各評価において、ultra のデフォルト設定(4 エージェント)と 1 エージェントのベースラインを比較したものです。また BrowseComp と SEC-Bench Pro では、16 エージェント構成の結果も示されています。3 つの評価すべてで並列エージェントを追加することで、スコアとレイテンシのフロンティアが右上方向へシフトし、より短い時間で強力な結果を実現しています。API においては、開発者は Responses API のマルチエージェントベータ版を活用して、ultra に匹敵する体験を構築できます。
GPT-5.6 は、デザイン判断において飛躍的な進化をもたらします。高レベルの指示のみを与えれば、洗練された、人間工学に基づき、かつ機能的なインターフェースを自動生成します。強化されたコンピュータ操作機能により、単にコードやコンテンツを作成するだけでなく、レンダリング結果を検証・改善することも可能です。これによって視覚的な不具合や機能上の問題を事前に発見し、納品前に仕上げを施すことができます。
GPT-5.6 のフロントエンド能力は、ChatGPT Work 内で自然言語によるリクエストを、洗練された対話形式の説明やビジュアライゼーションへと変換します。
GPT‑5.6 は専門的なタスクにおいて、より優れた結果をもたらします。ドキュメントや Slack、Notion、Microsoft 365、Google Drive といった日常のワークフローから生じる複雑なコンテキストを取り込み、それを専門家レベルで共有可能な成果物へと変換します。
GPT‑5.6 の知識労働における強みは、長期にわたる専門分析やブラウジング、ツール利用、コンピューター操作などを含む評価において顕著です。GPT‑5.6 Sol は BrowseComp で 92.2%、OSWorld 2.0 では 62.6% という新たな最高記録を達成しました。特に OSWorld においては、Opus 4.8 を上回りながら、出力トークンを 85% も削減しています。このパフォーマンス対コストの向上は、GPT‑5.6 ファミリー全体にわたって見られます。Luna は推定コストが半分未満で GPT‑5.5 の最高性能にほぼ匹敵し、Terra はさらに低コストでそれを上回ります。
*BrowseComp: GPT‑5.6 Sol は、エージェントによるブラウジングタスクからなる BrowseComp で新たな最高記録を達成しました。*
GPT‑5.6 Sol はプレゼンテーション、ドキュメント、スプレッドシートの品質を向上させ、より洗練され正確な成果物を生み出します。 完全な編集可能なプレゼンテーションをゼロから作成でき、プロンプトとソース資料を基に、レイアウトや階層性、デザイン性を重視した一貫したビジュアルナラティブへと変換します。
テンプレートや参考資料の活用においては、その改善効果が特に顕著です。GPT‑5.6 はスライドのデザインシステム——レイアウト、タイポグラフィ、余白、配色、そしてスライドマスターに埋め込まれたルールを含む反復的なコンテンツパターン——を推論し、新しい素材にも一貫してこれらの様式を適用できます。
この例では、参考ファイルに基づいて数値を更新するよう指示された際、GPT‑5.5 の出力はマスタースライドの重要な要素が欠落している一方、GPT‑5.6 は参照構造をより忠実に再現しています。



GPT‑5.6 は、より視覚的に洗練されたドキュメントやスプレッドシートも作成します。複雑な参照フォーマットを忠実に守るため、反復的な知識労働の場面で特に重要です。数式や財務モデルの処理精度が向上し、タイポグラフィ、余白、階層構造、ページやワークシートのレイアウト活用においてもより優れた成果を生み出します。
GPT-5.6 の初期テストユーザーは、ドメインを問わず知識労働の成果物に改善が見られることを確認しました。
1 of 9
GPT-5.6 はこれまでにない最強のサイバーセキュリティモデルです。より少ないトークン数でフロンティアレベルのパフォーマンスを実現しています。ExploitBench2 では、脆弱なコードへの到達から任意コード実行に至るまでの進捗を測定するこのベンチマークにおいて、出力トークンの予算を同等に設定した場合、GPT-5.5 の 47.9% を大きく上回る 73.5% のスコアを記録しました。ExploitGym3 では、実世界の脆弱性を動作するエクスプロイトに変換するようエージェントに指示を与えるテストで、2 時間の制限時間下では GPT-5.5 の最高通過率(15.1%)をほぼ倍増し、24.9% に達しました。6 時間の制限時間であれば 33.7% に到達します。SEC-Bench Pro では複雑なソフトウェアにおける概念実装の生成能力を検証するテストで、GPT-5.5 の 45.8% を上回る 71.2% のスコアを、より短いレイテンシで達成しました。
GPT-5.6 は、セキュアコードレビュー、パッチ適用、脅威モデリング、ブルーチーム演習といった重要な防御タスクにも対応しています。OpenAI Daybreak のサイバーセキュリティプログラム「Trusted Access for Cyber」 に参加する認定された個人や組織は、承認された環境での検証済み作業に対してより精密なセーフガードを適用することで、脆弱性のトリアージと検証、マルウェア分析、検出エンジニアリング、パッチ検証といった防御機能のさらに深い利用が可能になります。
*ExploitBench: 段階的に能力を高めた V8 エクスプロイトの構築。GPT-5.6 は GPT-5.5 より大幅な進歩を示しました。レイテンシチャートは掲載していません。このベンチマークではレイテンシ推定が信頼できないためです。*
GPT-5.6 Sol は、科学研究の分野でも幅広い成果を示しています。生命科学の評価において、GPT-5.6 は実世界の生物学、生命科学研究ワークフロー、化学の各領域で GPT-5.5 を上回るパレート最適化を達成しました。
*GeneBench Pro*: 長期にわたるゲノム解析や定量的生物学分析において、GPT-5.6 はより少ないトークン数と短時間で優れた結果を出しています。Claude Fable 5 は、高度な生物学の質問に回答できず、この評価で提示された大半の質問を拒否しているため、今回は対象から外れています。
GPT-5.6 は、AI 研究の加速に向けた当社の最も強力なモデルです。OpenAI 内部では、研究者が開発プロセス全体でこれを利用しています。具体的には、失敗原因の特定、トレーニングシステムの最適化、実験の実行、結果の解釈などです。GPT-5.6 の社内テスト期間中、すでにその加速効果と採用率の高さが確認されており、アクティブな研究者 1 人あたりの平均日次出力トークン数は、GPT-5.5 で観測された最高値の 2 倍以上に達しました。
この働き方は急速に標準化されつつあります。過去 6 ヶ月間で、研究計算資源のうち内部コード推論に割かれる割合は 100 倍に増大し、内部の自律型エージェントによるトークン使用量は約 22 倍に増加しました。これらの採用指標自体が研究の進捗を直接測るものではありませんが、AI の支援が研究部門だけでなく、営業、マーケティング、ユーザー運営、財務など他のチーム全体でいかに急速に拡大しているかを示しています。
この能力を直接的に測定するため、私たちは実際の AI 研究タスクに基づいた内部評価スイートを開発しました。具体的には、研究システムのデバッグ、カーネルやトレーニングレシピの最適化、機械学習実験の実行、および他モデルの改善などです。
*集計 RSI 能力:再帰的自己改善に向けた進捗を測定する一連の評価において、GPT‑5.6 Sol は GPT‑5.5 よりも 16.2 ポイント向上しており、社内研究全体が加速していることが確認できます。*
モデルの能力が高まるにつれ、高度な知能が広く有用であり続ける一方で、最もリスクの高い用途に対してより厳格な審査が行われるよう、安全性スタックを強化しています。GPT‑5.6 については、これまでに構築した中で最も堅牢な安全システムを整備しました。これは各モデルの能力に適合するように調整され、過去最大規模の計算資源によって支えられています。
GPT-5.6 モデルは、バイオロジーとサイバーセキュリティの両分野において、以前のモデルよりも能力が高まっています。ただし、いずれの分野でも「クリティカル・スレッショルド(重大な閾値)」を超えることはありません。
サイバーセキュリティにおいては、テスト結果から GPT-5.6 が脆弱性の発見や修正には優れているものの、堅牢化された標的に対して自律的なエンドツーエンド攻撃を確実に実行する点ではまだ課題があることが示されています。これは、弱点が悪用される前に防御側がシステムを強化できる機会を提供することになります。
バイオロジー分野においても、テスト結果から GPT-5.6 が正当な研究活動を支援することは可能ですが、極めて危険な新規脅威を作成・設計・合成するためのエンドツーエンドの能力は提供しないことが確認されています。
両方の分野には本質的にデュアルユース(二重利用)の性質があります。サイバーセキュリティでは、攻撃者が脆弱性を悪用するために使用する機能と、防御側がそれを発見し、再現し、信頼性の高い修正プログラムを開発するための機能が同じです。そのため、過度な規制はそれ自体が新たなセキュリティリスクを生み出します。防御側のシステムテストやパッチ適用を妨げる一方で、悪意のあるアクターたちは他のモデル、特に能力が高まるオープンソースモデルや既存のツールを使い続けるからです。
効果的なセーフガードとは、リクエストの文脈と予想される結果を考慮した上で、正当な防御活動は維持しつつ、有害行為の重大なリスクが示唆される領域に対してはより厳格な制御を適用するものです。
GPT-5.6 のセーフティ機能は、精度と冗長性を高めるために多層構造で設計されており、新たな攻撃が現れた際にも迅速に適応できるようになっています。モデルに組み込まれた保護機能は、リアルタイムチェックや継続的な監視、アカウントレベルでの強制力のある対策と連携し、特定のレイヤーが想定通りに作動しなくてもシステム全体を安全に保ちます。
多くのシステムでは、危害を防ぐために分類器のフラグのみを頼りにブロック判断を行っており、変更が難しい低知能モデルに依存しています。一方、私たちのアプローチは会話内容をレビューして潜在的な危害の有無を判定する「推論モニター」を追加しました。この設計により、深刻な悪用は確実に防ぎつつ、防御に関する研究開発も可能になります。また、最も機密性の高い機能については、信頼されたユーザーのみがアクセスできる「Trusted Access(信頼済みアクセス)」を通じて提供しています。
一部の保護機能にはテスト時の推論を活用しているため、分類器をゼロから再学習し直すことなく、迅速にアップデートして隙間を埋めることが可能です。
私たちは、システムを適応型攻撃から守り続けるため、より慎重なアプローチを採用しています。以前のモデルと比較して、GPT‑5.6 Sol のサイバーセキュリティ対策は、潜在的に有害な活動を約 10 倍多くブロックします。これらの対策が正当な利用にも摩擦をもたらす可能性があるため、ChatGPT と Codex では、低能力のモデルでプロンプトを簡単に再試行できるオプションを提供しています。私たちは、高い堅牢性を維持しつつ、安全対策が正当な利用に与える影響を継続して軽減していく方針です。これは、現実世界での利用から得た知見に基づいて改善しながら、慎重に開始する私たちの反復的な展開アプローチを反映したものです。
一般提供に先立ち、これまでで最も集中的な安全性評価を実施しました。これには、広範なレッドチーム演習、外部専門家との能力および安全対策のテスト、そして約 700,000 GPU アワー(A100e)にわたるブラックボックス自動レッドチームングが含まれます。これらの取り組みにより、システムの潜在的な弱点を体系的に調査し、脱獄攻撃の兆候を表面化させ、リリース前にシステムを強化することが可能になりました。
完璧なセキュリティなど存在しません。私たちは、能力が向上するモデルをより安全に守るための取り組みを継続しています。新たな脆弱性や既存の防御策を迂回する新しい Jailbreak(脱獄)が発見されることも避けられません。また、モデルの世代が進むごとに、攻撃や悪用の新たな経路も生まれます。私たちはこうした現実に対応するため、多層化された防御策、常時監視、迅速な対策、そして防御コミュニティ全体での連携を築いています。
GPT‑5.6 においては、既存のセキュリティプログラムと生物学バグバウンティプログラムに加え、新しい迅速対応プロセスとこれまでで最も強力な監視体制を整備しました。研究者からの報告や監視データ、実際の悪用例は、継続的な評価強化と防御策の改善にフィードバックされます。
GPT‑5.6 は 3 つのモデルティアで構成されています。フラッグシップモデルである「Sol」、GPT‑5.5 と同等のパフォーマンスを持ちながら低コストな「Terra」、そして最速かつ最も手頃な価格の「Luna」です。「5.6」という数字は世代を示し、Sol・Terra・Luna はそれぞれ独自のペースで能力を向上させていく永続的なティアです。
GPT‑5.6 は本日より、ChatGPT、Codex、および OpenAI API で利用可能になりました。グローバルでの展開は現在開始され、今後 24 時間かけて順次、完全な利用が可能になります。
- チャット: Plus、Pro、Business、Enterprise ユーザーは、中程度以上の努力設定で GPT‑5.6 Sol にアクセスできます。Pro と Enterprise ユーザーはさらに、複雑なタスクに対して最高品質の結果を得るために GPT‑5.6 Sol Pro を選択することも可能です。
- ChatGPT Work と Codex: Free および Go ユーザーは GPT‑5.6 Terra にアクセスできます。Plus、Pro、Business、Enterprise ユーザーは、GPT‑5.6 Sol、Terra、Luna から選択し、それぞれに対して努力レベルを設定できます。
maxは ChatGPT Work と Codex で GPT‑5.6 にアクセスできる全ユーザーが利用可能で、設定からオンオフ切り替えが可能です。ChatGPT Work ではultraが Pro と Enterprise ユーザー向けに提供され、Codex では Plus 以上のプラン対象となります。 - API: 開発者は OpenAI API を通じて Sol、Terra、Luna にアクセスできます。Responses API におけるプログラムによるツール呼び出し機能を使えば、GPT‑5.6 はメモリ内でプログラムを記述・実行してツールを調整し中間結果を処理できるため、ゼロデータ保持(ZDR)にも対応しています。マルチエージェント機能はベータ版として初公開され、GPT‑5.6 が並列でサブエージェントを実行し、その成果を単一のリクエスト内で統合することを可能にします。
GPT‑5.6 の料金は、3 つのモデルサイズそれぞれで 1M トークンあたり課金されます。Sol は入力 $5・出力 $30、Terra は入力 $2.50・出力 $15、Luna は入力 $1・出力 $6 です。
GPT‑5.6 ではプロンプトキャッシングの予測性も向上し、明示的なキャッシュブレイクポイント のサポートや、キャッシュ有効期間の最低 30 分が導入されました。GPT‑5.6 以降のモデルでは、キャッシュへの書き込みは非キャッシュ入力料金の 1.25 倍で課金されますが、キャッシュからの読み出しには引き続き 90% オフの割引が適用されます。
Professional
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|---|---|
| エージェント最終試験 | 52.7% | 50.4% | 50.3% | 46.9% | 40.5% | 45.2% | 32.1% | — |
| GDPval-AA v2 | 1,747.8 Elo | 1,593 Elo | 1,591.8 Elo | 1,493.7 Elo | 1,759.6 Elo | 1,600.1 Elo | 962.3 Elo | 1,348.8 Elo |
| 経営コンサルティングタスク(社内) | 43.2% | 37.2% | 35.4% | 31.3% | 35.5% | 31.6% | 13.2% | — |
| Big Finance Bench | 53% | 51% | 36% | 49% | — | 44% | — | — |
| Artificial Analysis Intelligence Index v4.1 | 58.9 インデックススコア | 55 インデックススコア | 51.2 インデックススコア | 54.8 インデックススコア | 59.9 インデックススコア | 55.7 インデックススコア | 46.5 インデックススコア | 50.2 インデックススコア |
コーディング
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|---|---|---|
| Artificial Analysis Coding Agent Index v1.1 | 80 Index score | — | 77.4 Index score | 74.6 Index score | 76.4 Index score | — | — | 77.2 Index score | 72.5 Index score | 42.7 Index score |
| SWE-Bench Pro | 64.6% | — | 63.4% | 62.7% | 59.4% | 80.3% | 77.8% | 80% | 69.2% | 54.2% |
| DeepSWE v1.1 | 72.7% | — | 69.6% | 67.2% | 67% | — | — | 69.7% | 59% | 11.8% |
| Terminal-Bench 2.1 | 88.8% | 91.9% | 87.4% | 84.7% | 85.6% | 88% | — | 83.1% | 78.9% | 70.7% |
科学と健康
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|---|---|
| GeneBench Pro | 28.7% | 23.3% | 10.8% | 12% | — | 16% | 3.1% | 8.14% |
| LifeSciBench | 59.9% | 56% | 51.2% | 50.4% | — | 53.6% | — | — |
| MedChemBench (Internal) | 48.3% | 35% | 30.4% | 35.5% | — | — | — | — |
| HealthBench Professional⁶ | 60.5% | 57.7% | 55.7% | 49.5% | 60.9% | 53% | — | — |
コンピュータ操作
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|---|---|
| OSWorld 2.0 | 62.6% | — | 50.2% | 45.6% | 47.5% | — | — | 54.8% | — |
| BrowseComp | 90.4% | 92.2% | 87.5% | 83.3% | 84.4% | 88% | 87.9% | 84.3% | 85.9% |
| BenchCAD | 70.6% | — | 62.3% | 63.1% | 44.4% | 38.4% | 35.5% | 27.3% | — |
| BenchCAD (python tool) | 83.4% | — | 78.2% | 73.9% | 55.8% | 65% | 61% | 51.8% | — |
セキュリティ
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Sol Ultra | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Opus 4.8 |
|---|---|---|---|---|---|---|---|---|
| Capture-the-Flag Challenges | 96.7% | — | 91.8% | 85.2% | 88.1% | — | — | — |
| SEC-Bench Pro | 71.2% | 74.3% | 57.7% | 48.9% | 45.8% | — | — | — |
| CyberGym | 84.5% | — | 81.8% | 77.9% | 81.8% | 83.8% | 83% | 78.1% |
| ExploitBench | 73.5% | — | 52.9% | 33.2% | 47.9% | 78% | 74.2% | 40% |
| ExploitGym | 33.7% | — | 23.2% | 12.4% | 15.1% | — | — | — |
自己改善
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 |
|---|---|---|---|---|
| 内部研究デバッグ評価 | 68.3% | 67.8% | 50.8% | 50% |
| KernelGen 1P | 61.1% | 49.2% | 22.4% | 29.3% |
| NanoGPT | 9.69% | 14.5% | 1.66% | 2.65% |
| PostTrainBench Lite | 50.3% | 51.5% | 29.6% | 38.8% |
| RSI Index | 57.9% | 56.3% | 41.9% | 41.7% |
多様なモダリティ
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|
| MMMU Pro (ツールなし) | 83% | 80.7% | 78.4% | 81.2% | — | — | 80.5% |
| MMMU Pro (ツールあり) | 84.6% | 82% | 79.5% | 83.2% | — | — | — |
| gdp.pdf | 30.7% | 24.7% | 22.7% | 26% | 29.8% | 22.5% | 16.7% |
学術分野
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|---|---|---|
| GPQA Diamond | 94.6% | 92.9% | 92.3% | 93.6% | 94.1% | 94.6% | 92.6% | 92% | 94.3% |
| FrontierMath Tier 1-3 (v2) | 89% | 84.9% | 78.6% | 85.3% | — | — | 87% | 80% | 59.6% |
| FrontierMath Tier 4 (v2) | 83% | 68.3% | 58.5% | 72.5% | — | — | 87.8% | 56.1% | — |
ツール利用
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Fable 5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview | Gemini 3.5 Flash |
|---|---|---|---|---|---|---|---|---|---|---|
| AutomationBench | 18.1% | 15.2% | 14.9% | 12.9% | — | — | 17.4% | 15.5% | — | 14.5% |
| Toolathlon | 58% | 53.1% | 53.4% | 55.6% | 61.7% | 61.1% | 61.7% | 59.9% | 48.8% | — |
長いコンテキスト
| 評価 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Mythos 5 | Claude Mythos Preview | Claude Opus 4.8 |
|---|---|---|---|---|---|---|---|
| OpenAI MRCR v2 8-needle 256K-512K | 91.5% | 89.6% | 41.3% | 81.5% | — | — | — |
| OpenAI MRCR v2 8-needle 512K-1M | 73.8% | 72.5% | 41.3% | 74% | — | — | — |
| GraphWalks BFS 256k f1 | 90.7% | 76.9% | 81.3% | 73.7% | 91.1% | 85.7% | 85.9% |
| GraphWalks BFS 1mil f1 | 77.1% | 71.2% | 51.2% | 45.4% | 79.4% | 74.3% | 68.1% |
抽象推論
| 評価項目 | GPT‑5.6 Sol | GPT‑5.6 Terra | GPT‑5.6 Luna | GPT‑5.5 | Claude Opus 4.8 | Gemini 3.1 Pro Preview |
|---|---|---|---|---|---|---|
| ARC-AGI-3⁷ | 7.78% | 0.8% | 0.18% | 0.43% | 1.5% | 0.42% |
AI算出
主要ニュースainew評価高い
記事は AI モデルの最新バージョンと性能向上に関する一次情報を報じており、新規性と検索意図が明確に一致する。日本固有の情報や企業事例は含まれていないため関連性は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み