Opus 4.6、Codex 5.3、そしてベンチマーク後の時代
本文の状態
日本語全文を表示中
詳細モードで約11分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Interconnects
OpenAIとAnthropicは2月5日、それぞれコーディング支援モデル「GPT-5.3-Codex」と「Claude Opus 4.6」を発表した。Anthropicは既存のClaude Codeによる性能向上で注目を集めており、ソフトウェア開発の変革とML研究の加速が示唆されている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
先週木曜日、2月5日、OpenAI と Anthropic はそれぞれコーディングアシスタントとして設計された次世代モデル、GPT-5.3-Codex と Claude Opus 4.6 を発表しました。これに先立ち、Anthropic は「エージェント」という新たな世界に人々が総じて取り組む中で、特に Claude Code(Opus 4.5 に起因するパフォーマンスの劇的向上)によって主導される中、世論を掌握していました。本稿ではソフトウェアが永遠に変化している様子や、Moltbook が未来を示唆している点、機械学習研究の加速、そしてより広範な影響について掘り下げるのではなく、新しいモデルをどのように評価し、受け入れ、準備すべきかに焦点を当てます。Opus 4.6 と Codex 5.3 の間の微妙な差は、今年発表される多くのモデルバージョンで感じられることになるでしょうが、使いやすさという点では Opus がこの対決において先行しています。
これらのリリースに臨むにあたり、私は Claude Code を一般的なコンピュータエージェントとして幅広く活用しており、ソフトウェアエンジニアリングやデータ分析、自動化などにも取り組んでいました。Codex 5.2(通常は xhigh で最大思考努力を要請)には試行しましたが、私の広範で横断的なタスクセットの中では、期待通りに機能しないと感じました。
ここ数日、私は両方のモデルをより均等に使用してきました。これは大変な誉め言葉ですが、Codex 5.3 は非常に Claude に似ており、フィードバックがはるかに速く、git からデータ分析に至るまで幅広いタスクにおいてはるかに能力が高いと感じます(以前の Codex バージョン、5.2 まで含めても、新しいブランチの作成といった基本的な git 操作を定期的に失敗していました)。Codex 5.3 は、製品と市場の適合性が向上したことで、Claude の領域へと向かう非常に重要な一歩を踏み出しました。これは OpenAI にとって極めて重要な動きであり、両モデルを比較すると、Codex 5.3 はその前身とははるかに異なる印象を受けます。
この文脈における OpenAI の最新 GPT は、より優れたコーディングモデルとしての優位性を保っています。この一般的な主張を正確に記述するのは難しく、多くは他者の成果を読むことに基づいていますが、コードベース内のバグの発見や修正、私の RLHF Book(強化学習による人間フィードバック)のための最小限のアルゴリズム例などにおいて、少しだけ優れているように思われます。私の経験では、これは微細な優位性であり、コミュニティはこの点が複雑な状況(つまり、大半の「雰囲気コーディング」されたアプリではない場合)で最も顕著であると信じています。
ユーザーがこれらの新しいエージェントを監督するスキルを高めるにつれ、ソフトウェアの理解と作成における最高レベルの能力を持つことが、Codex 5.3 にとって意味のある優位性となる可能性がありますが、今日では明白な利点とは言えません。AI 分野での私の最も信頼できる友人の多くは、Codex を支持しています。それは単にほんの少しだけ優れているからだと信じているからです。私はそのポテンシャルを引き出すことができていません。
Opus 4.6 から Codex 5.3 に切り替えると、「このブランチをクリーンアップして PR をプッシュする」ようなやや日常的なタスクを行う際、より詳細な説明が必要でモデルの世話を焼かざるを得ないような感覚になります。Claude なら修正の文脈を理解し、概ね正しく処理してくれると信頼できますが、Codex はファイルをスキップしたり、変な場所に配置してしまったりすることがあります。
これらのリリースはどちらも、企業がモデルの機能や実行速度を追求する一方で、使いやすさという代償を支払っているように感じられます。私は、複数のタスクを一括で指示した場合に、Opus 4.6 も Codex 5.3 も指示を無視してしまうことがあると発見しました。これらは特に Codex がそうですが、範囲が明確で問題がはっきりしている場合に最もよく機能します。Claude Code のハーン(制御枠)には、サブエージェントがターミナルをフリーズさせるというひどいバグがあり、新しいメッセージでは「コンパクト化またはクリアが必要」と表示されるものの、コンパクト化自体は失敗してしまいます。
Codex による大きな一歩にもかかわらず、製品面での Claude との差はまだ依然として大きく埋めるべき課題が残っています。Opus 4.6 は正しい方向へのさらなる一歩であり、Claude Code は素晴らしい体験をもたらします。親しみやすく、私が試す幅広いタスクに対して概ね動作し、これが Codex よりもはるかに広い採用につながることでしょう。ソフトウェア経験が限られているか全くない聴衆にコーディングエージェントを推薦するならば、間違いなく Claude になります。エージェントが一般利用へとようやく登場したこの時期において、これはマインドシェアと使用データに基づくフィードバックの両面で大きな優位性です。
その一方で、どのユースケースにどのエージェントを使用すべきかという明確な指針はなく、常に複数のモデルを使用し、エージェントを管理するスキルを維持する必要があります。
Interconnects AI は読者支援型の出版物です。購読をご検討ください。
2026 年のモデル評価
2025 年を通じて、モデルリリースに伴うベンチマークがユーザーにとって意味のあるシグナルを伝えなくなっていく AI 世界へと向かっているという多くの兆候がありました。かつて GPT-4 や Gemini 2.5 Pro がリリースされた時代には、その日のチャットボットのフォームファクター内でベンチマークの差分を容易に実感できました——モデルはより信頼性が高く、より多くのタスクを実行可能でしたなどです。これは OpenAI の o3 などのモデルを通じても続きました。この AI の構築フェーズ、おおよそ 2023 年から 2025 年にかけて、私たちは現代の言語モデルの中核機能(ツール使用、拡張推論、基本的なスケーリングなど)を組み立てていました。その向上は明白でした。
Opus 4.6 と Codex 5.3 の両方のリリースにより、ベンチマークに基づくリリースへの反応がほとんど重要ではないことは明らかです。今回のリリースでは、私は評価スコアをほとんど見ませんでした。Opus 4.6 がわずかに検索スコアで優れていたこと、Codex 5.3 が回答あたり遥かに少ないトークン数を使用していることは確認しましたが、これらはいずれも、これらのモデルが大幅に優れていると確信させるものではありませんでした。
各 AI ラボと、それらを報道するメディア生態系は、それぞれ独自のペースで標準的な評価からの移行を遂げてきました。最も示唆に富む例として挙げられるのは、2025 年 11 月の Gemini 3 Pro のリリースです。当時の全体的な雰囲気は「Google が再び主導権を握った」というものでした。サンフランシスコ在住のニューヨーク・タイムズ記者で自らを「AGI に目覚めた(AGI-pilled)」と称するケビン・ルーズ氏は次のように述べています。
"どうやら、ここ数年 AI 分野で苦戦していた Google が、Bard のローンチやいくつかの問題を抱えていた Gemini の初期バージョンを経て、ついに最先端に追いつきつつあるという見方がありました。そして今、問われているのは、これが彼らが王冠を取り戻す瞬間なのかということです。"
Gemini 現在の危機の深さについて詳しく論じる必要はありませんが、コーディングエージェントの最前線においては、その影響は実質的にありません。この分野こそがパフォーマンスにおける劇的な飛躍、あえて言えば、「リモートワーカー」という概念を中心とした多くの一般的に受け入れられている AGI の定義さえもが実現される可能性が最も高い領域だと感じられます。しかし、彼らの戴冠から 2 ヶ月後にはタイムラインが彼らを置き去りにしており、Gemini 3 は偽の王として称賛されたことが示されました。
一方の極端にあるのが Anthropic です。Anthropic が 2025 年 5 月に Claude 4 をリリースした際、私は彼らのコードへの賭けに懐疑的でした。OpenAI と Gemini が数学における IMO(国際数学オリンピック)金メダル達成などのモデル発表やその他の評価における画期的な成果を競い合う華やかさに気を取られていたからです。
Anthropic は、そのビジョンの焦点化に対して真剣に評価されるべきです。彼らがエージェントの来るべき役割に気づいていなかった AI ラボが他になかったとは限りませんが、メッセージや優先順位をこの方向へシフトさせた点では、断然彼らが最初でした。2025 年 6 月の私の投稿(Claude 4 のリリースから 1 ヶ月後)において、私は標準的なベンチマークの優先度を下げる判断が正しいと理解し始めていました。
これは業界にとって異なる道であり、私たちが慣れ親しんできたものとは異なる形でのメッセージングが必要になります。今後のリリースは、Anthropic の Claude 4 のように、ベンチマークでの向上はわずかである一方、実世界での進歩は大きな一歩となるものが多くなるでしょう。これに伴い、政策、評価、透明性に関する多くの含意が生じます。特に AI に批判的な人々が評価の横ばいを「AI はもはや機能していない」と主張する機会として利用する中で、進捗ペースが継続しているかどうかを理解するには、はるかに繊細な配慮が必要になります。
この状況は、2026 年の Interconnects のモデルレビューにおける役割について考えさせられます。2025 年は、多くの劇的なリリース日付のブログ投稿、多数の新規中国製オープンモデル開発者の参入、GPT-2 以来となる OpenAI の最初のオープン言語モデル、そして何よりも無限に過大評価された GPT-5 などによって特徴づけられました。これらのタイムリーなリリース投稿には依然として大きな価値がありますが、モデルが類似したままの場合、現在の AI フロンティアの複雑さを解きほぐすためにはほとんど役に立ちません。
独立した声として最前線のモデルを追跡する私の役割を果たすためには、私がどのようにモデルを使用し、なぜ使用し、なぜ使用しないのかについて、定期的に更新を提供し続ける必要があります。時間の経過とともに、業界はエージェント型モデルの違いをより明確に表現する方法を開発していくでしょう。今後数ヶ月、あるいは数年の間、私はエージェント機能における進歩のペースが非常に速く、また不均一であると考えており、一貫したテストと明確な表現こそがそれを監視するための唯一の方法になると予想しています。
コードエージェンツの新たな最前線は、サブエージェント(または「エージェントチーム」、これは一緒に作業できるサブエージェント)の使用にあります。ここで主要なオーケストレーションエージェントは、問題の一部に取り組むために自分自身のコピーを送り出します。Claude はここですでに少し先行しており、より洗練された機能を持っていますが、この領域は急速に進化し、おそらく OpenAI は GPT-Pro などの製品での経験を踏まえて Pro エージェントを構築できるかもしれません。
GPT-Pro シリーズのモデルは、Anthropic に対する OpenAI の大きな優位性です。私はこれらを常に使用しています。これらのエージェントをより複雑で長期的なタスクに使用するようになると、単一の課題に対してより多くの計算リソースを活用することが決定的な差別化要因となるでしょう。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み