GPT 5.4はCodexにとって大きな一歩
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Interconnects
筆者はGPT 5.4のレビューを遅延させた理由として、エージェント構築における重要軸の考察に時間を割いたことを明かす。従来のベンチマークが正解率という単一スコアに依存する限界を指摘し、より解釈可能な評価指標の必要性を示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私はこのモデルレビューに少し遅れて参加しましたが、そのおかげでエージェントにとって重要な軸について考える時間がより持てました。従来のベンチマークは、モデルの性能を正しさという単一のスコアに還元します。それが常にそうであるのは、単純であり、パフォーマンスを素早く評価するために使いやすく、といった理由からです。これはまた、優れたベンチマークを構築しようとする人々にも私がアドバイスしていることです——それは解釈可能な一つの数値に収約される必要があります。おそらく今後 1〜2 年してもこの傾向は続くでしょうし、エージェント向けのベンチマークもより良くなるでしょうが、現時点では、私たちが感じていることにはあまり対応していません。なぜなら、エージェントタスクとは正しさ、使いやすさ、速度、コストの混合体だからです。将来的には、これらの要素を個別に扱うベンチマークが登場するようになるでしょう。
GPT 5.4 はいくつかの紙上のベンチマークでは別の漸進的なモデルのように感じられるかもしれませんが、実際にはそれら 4 つの特性すべてにおいて意味のある一歩と感じられます。Codex における GPT 5.4(常に高速モードで、高または超高エフォート設定)は、投げかけられるあらゆるランダムなタスクを多くこなせるように感じる、最初の OpenAI エージェントです。
Interconnects AI は読者支援型の出版物です。購読をご検討ください。
ここ数ヶ月、私はソフトウェアエンジニアリングに深く携わってきたわけではありません。そのため、エージェントとの作業は主に小規模なプロジェクト(完全に一発屋ではありませんが、設計を数週間にわたって自ら構築・管理できるほど小さなもの)、データ分析、および研究タスクに限られていました。エージェントネイティブであることを受け入れると、このスタイルの作業には、多くの定期的な API 呼び出し、バックグラウンドパッケージ(LateX バイナリや ffmpeg、マルチメディア変換ツールのインストールと管理など)、git 操作、ファイル管理、検索などが伴います。
GPT 5.4 以前は、OpenAI のエージェントに対して「千切り殺し」のような状況に直面して常に離脱していました。まるで怒りによる即時撤退(rage quit)のように感じられました。GPT 5.2 Codex に近づいているかと思っても、git 操作で失敗し、私自身(または Claude)がリセットを余儀なくされるという結末でした。しかし、そのような硬直した壁はもはや存在しません。
GPT 5.4 の親しみやすさにおけるもう一つの微妙な変化、つまり OpenAI が再びエージェント戦争に本格的に参入したと私が考える最大の理由は、それが少しだけ「正しい」ように感じられる点にあります。私はこれを上記で議論した定型タスクとは異なるカテゴリーに分類しており、これは製品(つまりモデル・ハネス)がユーザーであるあなたに対してモデルの出力やリクエストなどをどのように提示するかに関係しています。また、いかに容易に深く入り込めるかという点にも関連します。これは常に Claude の最大の強みであり、その驚異的な成長の要因でした。Claude は非常に有用であるだけでなく、新規ユーザーを引きつけて留めておくための魅力と娯楽的価値も備えています。GPT 5.4 も同様の要素を少し持っていますが、根本的なモデルの強さにおいては Claude の方がまだ温かみを感じさせます。
Claude は性格があり、議論での言い回しも巧みで、時には何かを忘れるような超賢いモデルですが、Codex における OpenAI のモデルは、細部まで注意深く、やや冷たく、しかし非常に機械的な印象を受けます。私は Claude を、より多くの意見が必要とされるタスクに使い、GPT 5.4 は圧倒的に具体的な TODO リストを処理させるために利用します。GPT 5.4 の指示従順性はあまりにも正確なため、Claude と長時間過ごした後は、モデルとの対話方法を学び直す必要があります。Claude は特定のドメインにおいて、あなたの意図に対する優れたモデルであることがわかってきます。一方、GPT 5.4 は言われたことをただ実行するだけです。これらは「エージェントにとって最適なモデルとは何か」という点で非常に異なる哲学です。Claude はおそらく新規参入者にアピールするでしょうが、GPT 5.4 は分散タスクに AI 軍団を解放したいマスターエージェントコーディネーターにアピールすることになるでしょう。
魅力や、あえて言えば品味を除けば、多くの使いやすさの要素は OpenAI の側の方が実際には優れています。Codex アプリは魅力的です——必ずしも常に使うわけではありませんが、時には完全に気に入ります。これらのアプリの外観については、将来的に大きな革新が起きると予想しています。個人的には、最終的には Slack のようなものになるだろうと考えています(複数のエージェントが互いに通信する必要がある場合など、私の監視下で)。
Share
OpenAI は、サブスクリプション契約により、自社のモデルに対してネイティブの高速モードと非常に大きなレート制限も提供しています。私は長期間にわたり、月額 100 ドルの Claude プランと月額 200 ドルの ChatGPT プランを利用してきましたが、高速モードと xhigh(超高)推論設定において Codex の利用制限にほぼ達したことは一度もなく、Claude の制限には時々遭遇します。これには明確なモデル側の理由があります——OpenAI が公開するリリースブログのほとんどは、各反復的なモデルがピークベンチマーク性能を達成するために必要なトークン数が劇的に削減されていることを示しています。これは推論効率の指標です。この 2 次元(あるいはそれ以上)のベンチマークの状況こそが、世界が進もうとしている方向そのものです。
Cursor から提供されたグラフがありますが、残念ながら GPT 5.4 のすべての推論設定が含まれていないものの、第三者による評価においてこの点を裏付けています。モデルファミリー全体に共通して欠けているのは、そこに到達するための速度と価格(使用される総計算資源の代理指標)です。

GPT 5.4 の最終的な利点、そしてその文脈における OpenAI のエージェント型モデル全般に言えることは、はるかに優れたコンテキスト管理です。現在これらを定期的に使用していますが、コンテキストの壁やコンテキスト不安の限界に達したと感じたことはありません。推論効率が高まっていることが上記のような状況をもたらしていると考えられ、それによりモデルが初期状態の空のコンテキストウィンドウでより多くの処理を行えるようになっています。そして GPT 5.4 がコンパクション(圧縮)を実行する際にも、その変化は以前よりも目立たなくなっています。
私が Claude Opus 4.6 と GPT 5.4 の両方で経験している唯一の問題は、軽度の忘却です。計画モード外で単一のメッセージ内に複数の TODO リストをモデルに与えると、それらをしばしば見落としてしまうことがわかります。時にはモデルがバグを起こしたかのように感じられ、直近の課題ではなく過去の課題を解決しようとする場合があります。モデル内部やその実行環境(ハネス)のどこに正確な原因があるのかは不明ですが、時折、モデルが何か作業中であることを確認しながら複数のメッセージをキューイングしてタスクを洗練させたいと思うことがあります。しかし現在では、最も単純なユースケースを除き、これはかなりリスクの高い結果をもたらす傾向があります。
最近では、気分に左右されつつも GPT と Claude の両方を幅広く活用しており、これまで以上に多くの成果を得ています。GPT 5.4 Pro を Codex に直接統合し(例えば \ultrathink のような形)、OpenAI が他社との決定的な差別化要因とすることは大きな意味を持ちます。これらのモデルは本当に素晴らしいものです。
総括すると、私は GPT 5.4 を、GPT 5.3 Codex の非常に強力なソフトウェア基盤に、はるかにシンプルな使いやすさと「エージェント性」をもたらすアジェンシーモデルと捉えています。これは大きな一歩であり、次なるアップデートをどちらの企業が発表するかについて、私は信じられないほど興奮しています。紙面上では、GPT 5.4 の強みを、より優れたトップエンドのコーディングパフォーマンス、より高速な処理、より良いコンテキスト管理、より良いレート制限として列挙することは、モデル選択がいかに微妙でニュアンスに富んだものであるかを証明するものです。私は実際には、ベンチマークでは決して現れないような点において、まだ Claude を少しだけ好んで使っています。そのため、一日の始まりにターミナルに入力するのは Codex ではなく、Claude です。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み