OpenAI、GPT 5.6 Sol/Terra/Luna を発表
本文の状態
日本語全文を表示中
詳細モードで約15分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Smol AI News
OpenAI は GPT-5.6 シリーズ(Sol、Terra、Luna)を ChatGPT や API に展開し、価格帯と性能の明確な階層化、および新機能の実装を発表した。
AI深層分析を開く2026年7月29日 07:36
AI深層分析
キーポイント
3 モデルによる価格・性能の階層化
OpenAI は GPT-5.6 Sol(最高性能)、Terra(低コストで高品質)、Luna(高速・低価格)という 3 つのモデルを、価格と用途に応じて明確に区分けして発表した。
ユーザー層別アクセス戦略
ChatGPT の Plus、Pro、Business、Enterprise ユーザー向けに、Sol や Pro モデルへのアクセス権限をプランごとに細かく設定し、複雑なタスクには高品質モデルを選択可能とした。
API 価格体系とキャッシュ機能の刷新
API では入力・出力トークンごとの階層料金に加え、初めてキャッシュ書き込み料金を導入し、キャッシュ読み取りに対して 90% の割引を維持する新たな料金体系を発表した。
アプリ機能の統合と新ベータ
ChatGPT Work やデスクトップアプリ(Codex と ChatGPT の統合)、Sites ベータ、プログラムmatic ツール呼び出し、マルチエージェントベータなど、アプリケーション層での主要な変更をパッケージ化して発表した。
コスト効率と性能の両立
GPT-5.6 Sol は推論タスクで競合モデルより大幅に優れ、コストは約4分の1から6分の1に抑えられる。これは「目標パフォーマンスレベルに対する最安価格」の実現を意味する。
重要な引用
OpenAI launched a new three-model GPT‑5.6 family and simultaneously expanded the product stack around it.
Sam Altman called it “obviously the best model we have ever produced”
Sol = flagship/highest ceiling, Terra = GPT‑5.5-like capability at lower cost, Luna = fastest/cheapest high-volume option
"obviously the best model we have ever produced"
編集コメントを表示
編集コメント
今回の発表は、モデルの性能向上だけでなく、価格帯と機能の明確な分離によって市場の多様なニーズに応えようとする OpenAI の戦略的転換を示している。特に API におけるキャッシュ課金の導入は、大規模利用時のコスト構造に新たな基準をもたらす可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
静かな一日。
2026年7月8日〜9日のAIニュース。12のサブレッド、544件のツイート、およびDiscord(ディスコード)については追加情報はありませんでした。AINews のウェブサイトでは過去のすべての号を検索できます。念のためお知らせしますが、AINews は現在 Latent Space のセクションとなっています。メールの配信頻度を選択・解除することも可能です!
AI Twitter リキャップ
OpenAI は新しい 3 モデル構成の GPT‑5.6 ファミリーを発表し、同時にその周辺に製品スタックを拡大しました。**
- OpenAI は @OpenAI および @OpenAIDevs を通じて、ChatGPT、Codex(コードックス)、および API 全体で展開される GPT‑5.6 Sol、Terra、Luna の発表を行いました。
- ChatGPT では、Plus、Pro、Business、Enterprise ユーザーが medium+ エフォート設定を通じて GPT‑5.6 Sol にアクセスできるようになりました。一方、Pro および Enterprise ユーザーは、複雑なタスクにおける最高品質の結果を得るために GPT‑5.6 Pro を選択できます(@OpenAI による)。
- API の価格体系には段階的なラインナップが導入されました:Sol は入力/出力トークンあたり 100 万単位で $5 / $30、Terra は $2.5 / $15、Luna は $1 / $6 です。また、@ArtificialAnlys によると、初めてキャッシュ書き込み価格が設定され、キャッシュ読み取りに対する 90% の割引は維持されています。
- OpenAI はこのファミリーを価格と性能の階段として位置づけました:Sol はフラッグシップ/最高性能、Terra は低コストで GPT‑5.5 に匹敵する能力、Luna は高速かつ安価な大量処理向けオプションです(@OpenAIDevs による)。
- 本リリースには、主要なアプリケーション層の変更が含まれていました:ChatGPT Work(Codex と ChatGPT を統合した新しいデスクトップアプリ)、Sites ベータ版、プログラムによるツール呼び出し、および Responses API におけるマルチエージェントベータ版です。これらは @OpenAI、@OpenAIDevs、および @OpenAIDevs 経由で発表されました。
公式の主張とベンチマーク結果
OpenAI の公式メッセージは、強力なエージェント機能・コーディング性能、より優れたアーティファクト(成果物)の品質、そして改善された経済性(コスト効率)を強調しました。
- Sam Altman はリリース投稿で「明らかにこれまでで最も優れたモデルだ」と述べ、リリースブログへのリンクを共有しました。@sama 経由
- Altman はまた、企業の経済性を強調し、「5.6 sol はタスクあたりのドルコストにおいて大きな前進である」と述べています。@sama 経由
- Greg Brockman は、「あらゆる目標性能レベルに対して最良の価格を提供すること」および可能な限り高い上限(キャリング)を目標としていると述べました。@gdb 経由
- OpenAI は、GPT‑5.6 Sol が「Agents' Last Exam」で 53.6 という新記録を達成し、Claude Fable 5 adaptive を 13.1 ポイント上回ったと主張しました。中程度の推論タスクでは、Fable よりも 11.4 ポイント優れており、推定コストは約 4 分の 1 です。また、Terra と Luna も同様に Fable を上回り、コストは約 16 分の 1 で済みます。@OpenAI 経由
- OpenAI は、GPT‑5.6 がプレゼンテーション、ドキュメント、スプレッドシート全体でアーティファクトの品質を向上させ、出力を既存のエンタープライズツールにエクスポート可能であると述べています。@OpenAI 経由
- OpenAI は、GPT‑5.6 を ChatGPT Work 内で複雑なタスクの推論や、テンプレート、参照ファイル、好みのスタイルに合わせた資料作成において最先端のモデルとして位置付けています。@OpenAI 経由
- OpenAI はまた、GPT-5.6 がサイバーおよびバイオ関連のタスクにおいてこれまでで最も能力が高いモデルであると述べ、デュアルユース分野では追加の安全性レビューのために一部の API 呼び出しがブロックまたは一時停止される可能性があるとも発表しました。これは @OpenAIDevs を経由して伝えられています。
- OpenAI は、より優れた Computer Use パフォーマンスを強調しました。具体的には、処理速度の向上、トークン効率の改善、多段階タスクにおけるバッチ処理および並列操作への対応、さらにピクチャー・イン・ピクチャーによる監視機能のサポートです。これも @OpenAIDevs を経由して伝えられています。
独立した評価と第三者による測定
独立した評価では、Sol がコーディングエージェントワークロードにおいて特に最前線に近い、あるいはその位置にあると広く判断されましたが、同時にいくつかの注意点も浮き彫りにされています。
- @ArtificialAnlys は、GPT-5.6 Sol(最大値)が知能指数で 59 を記録し、Claude Fable 5(最大値)の 1 ポイント下である一方、タスクあたりのコストは Fable の約 3 分の 1であると報告しました。
- 同じ分析において、Terra と Luna は知能指数でそれぞれ 55 と 51 を記録し、Sol に比べてタスクあたりのコストがそれぞれ約 50% および約 80% 低いことが示されました。これは @ArtificialAnlys を経由して伝えられています。
- Artificial Analysis は、Sol がコーディングエージェント指数で 80 を記録し、Fable 5 や Opus 4.8 を上回っていると述べ、両モデルのハーン(評価環境)においてもタスクあたりのコストがより安価であると報告しました。これも @ArtificialAnlys を経由しています。
- また、Sol が知能と出力トークンの間で新たなパレートフロンティアを定義している一方で、Terra と Luna はそのフロンティア上にはないと指摘されました。これは @ArtificialAnlys によるものです。
- Artificial Analysis は、AA-Omniscience(全知性)において GPT-5.5 よりもわずかな改善が見られる一方、GPT-5.5 の最大値と比較して幻覚率が高かったことも発見しました。これも @ArtificialAnlys による報告です。
- @ArtificialAnlys によると、GPT-5.6 Sol/Terra/Luna は Claude Fable 5 と同様の GDPval-AA v2 パフォーマンスを報告しており、経済的に価値のあるタスクにおける能力は同等であると示唆されています。
- @ValsAI は GPT‑5.6 を Vals Index および Vals Multimodal Index で #2 にランク付けし、Fable 5 がいくつかのベンチマークで依然として先行しているものの、GPT‑5.6 は「明らかに同クラス」であると述べています。
- また Vals は、Sol が CyberBench と Excel Modeling Benchmark で #1 を獲得したほか、Legal Research Bench、ProofBench、SWE-bench、Terminal-Bench 2.1 でも #1 であるとし、Fable の CyberBench における拒否率がほぼ 100% に達していたことを付け加えています(@ValsAI 経由)。
- @arcprize は、GPT‑5.6 Sol が ARC‑AGI‑3 で 7.8% を達成し、ARC‑AGI‑3 ゲームを突破した史上初の検証済みフロンティアモデルであると発表しました。
- @GregKamradt は、ARC‑AGI‑2 で 92.5% を達成したことを指摘し、これを SOTA(State-of-the-Art)と称するとともに、3 ヶ月前の GPT‑5.5 Pro と比較してコストが桁違いに低いと述べています。
- @ArtificialAnlys は後に、GPT‑5.6 Sol (max) が未発表の研究レベルの物理問題からなるベンチマーク「CritPt」で Claude Fable 5 を約 4 ポイント上回っていると報告しました。
- @llama_index は、day-0 の ParseBench 結果について、GPT‑5.6 がテキストと表では依然として良好なパフォーマンスを示す一方で、チャートやレイアウトにはまだ課題があると指摘し、Luna は Sol に比べてコストが約 6 分の 1 で、性能低下はわずかであると述べています。
- @jerryjliu0 も同様に、ParseBench では GPT‑5.5 と比較して表・テキスト・チャート・レイアウトのいずれにおいても高レベルな変化は見られないとし、複雑なテキストレイアウト、チャートの文字起こし、ソース要素のバウンディングボックスにおける持続的な弱点を強調しました。
技術詳細
GPT‑5.6 の技術的物語は、純粋な能力だけでなく、推論のオーケストレーションとトークンの効率性についても語られています。
- OpenAI は複数の推論努力レベルを備えた 3 つのモデルティアをリリースしました。ユーザーからは Light、Medium、High、Extra High、Ultra といった議論がなされ、@rasbt 氏によるとこれにより大規模な構成マトリクスが生み出されました。
- OpenAI は Responses API およびマルチエージェントベータ版に「プログラムによるツール呼び出し」機能を追加し、オーケストレーションされたツールの使用やエージェントの分解に対するより明示的なサポートを示しました。これは @OpenAIDevs 氏からの情報です。
- @sama 氏と @gdb 氏によると、OpenAI のアプリ層では、新しい Work プロダクトの中核として Codex が採用されています。
- 複数の投稿で、並列エージェントやサブエージェントが主要な機能強化の要因であると強調されています。@aidan_mclau 氏は、ユーザーが GPT‑5.6 のサブエージェント数を増やすことができることを明確に言及しています。
- @LiorOnAI 氏は、主な推進要因として適応型推論、並列エージェント、プログラムによるツール使用、そして高いトークン効率性をまとめました。
- Artificial Analysis によると、Sol の最大値はインテリジェンスインデックスタスクあたり約 15k トークンの出力を使用し、これは GPT‑5.5 の 16k よりも少なく、同程度の知能レベルにおける Opus 4.8、GLM‑5.2、Gemini 3.5 Flash を下回っています。この情報は @ArtificialAnlys 氏によるものです。
- @OpenRouter 氏は、初期テストにおいて GPT‑5.6 モデルがよりトークン効率的であり、コストとタスク完了までの時間を両方とも低下させたことを報告しました。
- デスクトップおよびアプリ層では、Chrome 拡張機能、刷新されたアプリ内ブラウザ、認証済みサイト、永続的なマルチタブセッション、ファイルダウンロード、そしてより密接なクロスデバイス間のハンドオフが導入されました。これらは @OpenAIDevs 氏(3 回)からの情報です。
- @OpenAIDevs と @OpenAIDevs を通じ、GPT 構築型アプリ向けにホスティング、ストレージ、オプションの認証機能を提供する有料ユーザー向けベータ版が開始されました。
「Sol が自律的に Luna のポストトレーニングを行った」という主張について
これは発表に関連して最も挑発的な技術的声明でしたが、その解釈はほぼ即座に争点となりました。
- @scaling01、@tejalpatwardhan、@dejavucoder などの複数のアカウントが、OpenAI が GPT‑5.6 Sol に GPT‑5.6 Luna のポストトレーニングを自律的に行わせたという声明を広めました。
- この主張は RSI(自己再帰的インフラストラクチャ)や自動研究に関する憶測に火をつけました。@tenobrus は、もし声明通りであれば、自動化された研究者のタイムラインにとって「かなり大きな更新」になると述べています。
- @eliebakouch はこれを、OpenAI が実験のために Sol に 10 万個の GPU を用いて Luna のポストトレーニングを行わせるよう依頼したと解釈しました。
- @gdb は、これはエンジニアリングワークフローの加速という含意を見落としやすいが、OpenAI はこれが単なるマーケティングの飾りではないと読ませたいと考えていることを強調しています。
- しかし、懐疑的な補足説明もすぐに現れました。@nikolaj2030 は、これが Luna のエンドツーエンドの実世界におけるポストトレーニングではなく、設定ファイルの変更やスケジューラーファイルの編集、実行の開始といった小規模な制御されたポストトレーニングタスクを Sol が完了したことを意味するのではないか、と質問しました。
- @nrehiew_ も同様のスクリーンショット解釈を示し、Sol は高レベルのアイデアから設定ファイルの編集や実験の実行まで行うことはできても、Luna のエンドツーエンドのポストトレーニングを完全に主導しているわけではない、と解釈しています。
- @scaling01 は、おそらく起こっているのは、既存の OpenAI の RL 基盤の上に LLM-as-a-judge(LLM を審査員として用いる手法)による採点者、報酬整形ロジック、あるいは小規模なトレーニング設定を実装したモデルに過ぎないのではないか、自律的なエンドツーエンドの研究やトレーニングシステムではないと主張しました
- @scaling01 は明確に、これらの発言を、まだモデルが実行できない文字通りの自律的なエンドツーエンドのポストトレーニングや研究から切り離すべきだと述べました
- そのような懐疑論に対抗する形で、@aidan_mclau は、5.6 が自律的ではないにせよ意味のある内部ワークフロー自動化を示唆しつつ、彼にとって 5.6 の E2E(エンドツーエンド)が完全な RL ランを実行するのは日常茶飯事だと語りました
- 技術観察者たちのコンセンサスは、Sol が Luna を独自に発明して訓練したという点ではなく、GPT‑5.6 は成熟した内部インフラ内でモデル改善ワークフローの有意義な断片を実行可能になった可能性があるという点でした
内部生産性と再帰的改善のシグナル
OpenAI はまた、内部利用データを用いて GPT‑5.6 が研究者のスループットを劇的に変化させたことを主張しました。
- @scaling01 は、今年初頭以来、研究者あたりの実験スループットが倍増したという OpenAI の主張を強調しました
- @eliebakouch は、内部テストにおいて GPT‑5.5 で観測された最高レベルの 2 倍以上に達しているという、アクティブな研究者あたりの平均日次出力トークン数に関する OpenAI の発言を引用しました
- @eliebakouch が伝えた別の OpenAI の統計によると、過去 6 ヶ月間で内部コーディング推論に割り当てられた研究用計算資源の割合が 100 倍に増加し、内部エージェントによるトークン使用量は約 22 倍に増大した
- @FakePsyho はこれらの進展を、トップレベルのプログラミングコンテストにおける OpenAI のパフォーマンスと結びつけ、GPT‑5.6 に近いシステムやカスタムハーンネス(制御枠組み)がエリートな人間競技者を明確に上回っていると説明している
- これがより広範な RSI/自己研究(autoresearch)の議論を喚起し、特に長期スコープのコーディングやヒューリスティック最適化をモデル改善能力の代理指標と捉える人々の間で活発化した
製品への影響:ChatGPT Work、Codex の統合、デスクトップ版、および Sites
このモデル発表は同時に製品戦略のリセットでもあり、OpenAI は「チャットボット」から「ワーク OS(オペレーティングシステム)」へとシフトを推進している。
- OpenAI は、@OpenAI 経由で ChatGPT Work を発表した。これは Codex と GPT‑5.6 に支えられたエージェントであり、アプリやファイル間を横断して動作し、数時間にわたってタスクに没入し、目標から完成した成果物へと変換できる
- @kimmonismus によると、Work はドキュメント、Slack、Notion、Microsoft 365、Google Drive から文脈を取り込み、プレゼンテーション資料、ドキュメント、スプレッドシート、ダッシュボード、可視化データ、インタラクティブな解説を生成できる
- @avstorm と @OpenAIDevs の確認により、Codex アプリは新しい ChatGPT デスクトップアプリに統合された
- 開発者向けには、@romainhuet と @reach_vb が伝えた通り、インライン差分編集機能、PR(プルリクエスト)レビュー用のサイドパネル、SSH 動画レンダリングの改善、そしてより強力なコンピュータ操作能力が提供されるようになった
- @OpenAIDevs と @simpsoka によると、Sites を利用すれば、ユーザーは ChatGPT から作業成果物を共有可能なホスト済みアプリやウェブサイトに変換できる
- @OpenAI、@OpenAI、および@OpenAIは、ブロッコリー農家、数学者、そして家族経営のシリアルビジネスというケーススタディを通じて GPT‑5.6 を宣伝しました
- この製品の再定義は、一部の人々によって、@jerryjliu0 と @kimmonismus を通じて、Anthropic の Cowork / Claude Code スタックに対する OpenAI の回答として読み取られました
事実と意見
事実 / 直接出典に基づく主張
- GPT‑5.6 ファミリーの名称、ロールアウトチャネル、およびアクセスティア:@OpenAI、@OpenAI、@OpenAIDevs
- API 価格およびキャッシュ書き込みポリシー:@ArtificialAnlys
- エージェント最終試験における OpenAI のベンチマーク主張:@OpenAI
- Artificial Analysis および Vals リーダーボードでの順位:@ArtificialAnlys、@ValsAI
- ARC‑AGI‑3 7.8% という主張:@arcprize
- ParseBench の注意点:@llama_index、@jerryjliu0
- GPT‑5.6 Sol における脱獄( Jailbreak )を検出した安全性テストの結果:@alxndrdavies
意見 / 解釈 / 過熱した期待
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み