GPT-5.6 シリーズ(2 分読了)
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
OpenAI は 2026 年 7 月、ARC-AGI-3 で初めて勝利した GPT-5.6 Sol を含む 3 モデルを発表し、特に最大推論努力時の Sol が未見の環境への適応能力で他を凌駕していることを示した。
AI深層分析を開く2026年8月7日 12:47
AI深層分析
キーポイント
GPT-5.6 Sol の特異な性能
2026 年 7 月時点で唯一実用的なモデルとして、最大推論努力時に ARC-AGI-3 で 87% の成功率を記録し、同シリーズで初めてこの難問を解決した。
環境適応と再計画のメカニズム
Sol は失敗した仮説を無駄な試行錯誤ではなく再計画の契機として捉え、未知のシーンやゲーム独自の語彙を正しく理解して行動する能力を持つ。
推論強度によるスコア変動
Sol の ARC-AGI-3 での最高得点は 7.8%(Max)だが、推論努力レベルを下げるにつれて得点が急激に低下し、高度な推論が不可欠であることを示している。
他モデルとの比較
GPT-5.6 Terra や Luna は Sol に比べて ARC-AGI-3 でのスコアが著しく低く、Sol の環境適応能力は同シリーズ内でも突出している。
推論レベルによる性能の顕著な差
GPT-5.6 は「Extra High」レベルで ARC-AGI-3 の FT09 タスクにおいて 87.7% の正答率を記録したが、「Low」レベルでは 34.2% に低下し、推論強度によって性能が劇的に変動する。
重要な引用
Sol at max reasoning effort is the only performant model (as of July 2026) averaging 13.33% on Public and 7.78% on Semi-Private.
It is the first model to win an ARC-AGI-3 public game (ft09, 87%).
Sol is able to perform on ARC-AGI not because it executes better, but because it correctly orients itself in a new environment first.
Hardest tasks (fewest levels solving) are listed first.
編集コメントを表示
編集コメント
2026 年という未来の日付で発表された GPT-5.6 シリーズは、推論能力の質的転換を象徴するものである。特に Sol モデルが示す「環境適応」への注目は、次世代 AI の方向性を示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
GPT-5.6 シリーズ
OpenAI·2026 年 7 月 9 日·3 モデル·15 の推論バリアント
GPT-5.6 Sol は、GPT-5.6 ファミリーの中で際立つモデルです。最大限の推論努力を払った状態の Sol は、2026 年 7 月現在において唯一実用的なパフォーマンスを発揮するモデルであり、パブリック環境で平均 13.33%、セミプライベート環境で平均 7.78% のスコアを記録しています。Sol は、ARC-AGI-3 のパブリックゲーム(ft09)で初めて勝利したモデルでもあり(勝率 87%)、見知らぬシーンを正しく読み取り、かつそのゲーム独自の語彙を用いて処理することができます。Sol は失敗した仮説を「破綻させる理由」として扱うのではなく、「再計画を行うきっかけ」として捉えます。多くのエージェントの失敗は、彼らが記述するコードや実行するアクションよりも上流(設計段階など)に起因しています。Sol が ARC-AGI で成功するのは、単に実行が優れているからではなく、まず新しい環境において自らの立ち位置を正しく把握できるからです。
ARC-AGI 3 リーダーボード
GPT-5.6 Sol, GPT-5.6 Terra, GPT-5.6 Luna
検証済みスコア
モデル | バリアント | ARC-AGI-1 | ARC-AGI-2 | ARC-AGI-3
Sol | Max | 96.5% | 92.5% | 7.8%
| Extra High | 97.5% | 90.0% | 7.0%
| High | 97.0% | 85.4% | 2.1%
| Medium | 92.5% | 67.1% | 1.1%
| Low | 74.5% | 42.5% | 0.3%
Terra | Max | 96.5% | 83.9% | 0.8%
| Extra High | 94.0% | 74.2% | 0.7%
| High | 92.0% | 67.1% | 0.5%
| Medium | 77.0% | 37.5% | 0.1%
| Low | 60.2% | 18.8% | 0.0%
Luna | Max | 88.0% | 59.5% | 0.2%
| Extra High | 87.7% | 47.6% | 0.0%
| High | 76.5% | 29.3% | 0.1%
| Medium | 56.5% | 7.4% | 0.2%
| Low | 34.2% | 5.1% | 0.2%
タスクと環境
各ベンチマークにおける推論レベルごとの合格/不合格。最も困難なタスク(解決できるレベルが最も少ないもの)を先頭にリストします。
モデル
ARC-AGI-3 パブリックデモ
25 の環境
FT09
LP85
AR25
CN04
SP80
VC33
SC25
RE86
R11L
DC22
CD82
LS20
KA59
TN36
WA30
LF52
TU93
M0R0
TR87
SB26
BP35
G50T
SU15
S5I5
SK48
ARC-AGI-2 公開評価
120 のタスク
TaskMax
Extra High
High
Medium
Low
✗✗✗✗✗
✗✗✗✗✗
✗✗✗✗✗
✗✗✗✗✗
✗✗✗✗✗
✗✓✗✗✗
✓✗✗✗✗
✓✗✗✗✗
✓✓✗✗✗
✓✓✗✗✗
✓✓✗✗✗
✓✗✓✗✗
✗✓✗✓✗
✓✓✗✗✗
✓✓✗✗✗
✓✗✓✗✗
✓✓✗✗✗
✓✓✗✗✗
✓✓✗✗✗
✓✓✗✗✗
✓✓✗✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✗✓✓✓✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✗✓✓✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✓✗✗
✓✓✗✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✗✓✓
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✗✓✓
✓✓✓✓✗
✓✗✓✓✓
✓✓✓✓✗
✓✓✓✓✗
✗✓✓✓✓
✓✓✓✓✗
✓✓✓✗✓
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✗✓
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✗
✓✓✓✓✓
✓✓✓✓✓
✓✓✓✓✓
✓✓✓✓✓
✓✓<spa
AI算出
主要ニュースainew評価高い
記事は特定の AI モデルの性能向上とベンチマークでの画期的な達成を詳細に報告しており、新規性と検索意図が極めて高い。ただし、日本企業や日本固有の文脈に関する言及がないため、日本の関連性は低く設定した。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み