今日のオープンとクローズドモデルのパフォーマンス格差を読む
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Interconnects
記事は、オープンソースモデルがクローズドモデルに永続的に追従する現状を分析し、単一の数値で表される格差が実際の能力の微妙な動態を見誤らせると指摘する。主要指標であるArtificial Analysis Intelligence Indexを用いて、最先端の言語モデル能力を評価する。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
現在、オープンモデルはクローズドモデルの追跡を永遠に続けるという明確な均衡状態がありますが、このギャップを単一の数値、「距離」として捉えることは、モデルがカバーしている能力に関する微妙で重要なダイナミクスを覆い隠しています。このギャップについて言及する最も一般的なベンチマークは、Artificial Analysis Intelligence Indexです。これは、現在の言語モデルの「フロンティア」を捉えるために時間とともに維持される約10のサブ評価からなる複合ベンチマークです。
特に、私はパフォーマンスやトレンドを単一の数値に還元する人間の傾向によって、そのインデックスに影響を与えるダイナミクスが誤解されていることを理解することに多くの時間を費やしています。その例としては、以下のようなものがあります:
ベンチマークが時間とともにどのように進化し、人々が実際にモデルを使用する方法との相関が強くなったり弱くなったりするか、
異なるモデルの実世界のパフォーマンスがベンチマークランキングとどのように関係しているか、
そして、トレーニングレジームが時間とともに進化し、これらのベンチマークをどのように改善していくか。
アジェンティック・ベンチマークはある程度良好な状態にありますが、ベンチマークはもはや実世界のパフォーマンスとの相関関係として信頼されていません。このグレーゾーンにおける重要な例は、Gemini 3の驚くべきベンチマーク結果と、現在AIツールがテストおよび展開されている領域(エージェント)におけるその顕著な無関係さです。これらのトレンドは、私たちの測定方法に明白かつ永続的な欠陥があることを示しています。
共有
このダイナミクス、すなわち相関モデルの現実世界のパフォーマンスとベンチマークスコアとの関係性のダンスの根底にあるのは、業界における絶え間ないシフトです。すべてのモデル、つまりオープンソースとクローズドの両方が時間とともに進化していくにつれて、ベンチマークの対象となるトピックは約12〜18ヶ月ごとにシフトしていきます。関心の高いすべてのドメインには、特にポストトレーニングの段階において、それぞれ異なる関連する学習ドメインが存在します。単一のパラダイムが長く続けば続くほど、業界はパフォーマンスの測定においてより熟練していきます。急速なポストトレーニングの改善という新しい時代において、私はベンチマークに対する個人的な信頼度を相対的な最小値と見なしています。
タスクの進化とLLMのパラダイム
ChatGPT直後、焦点はチャット、数学、そして単純なコードの混合でした。インストラクションチューニングとRLHF(Reinforcement Learning from Human Feedback:人間のフィードバックによる強化学習)が支配的でした。チャットの機能は飽和状態に達し、すぐに衰退しました。その後、数学が焦点から外れていきました。2025年から現在に至るまで、特に推論モデルがデフォルトとなった以降、焦点はより複雑なコーディングやその他の単純なエージェントタスクへとシフトしました。私たちはこの最初の時代の終盤にいます。最近のトレーニングレシピはすべて、検証可能な報酬を用いた強化学習(RLVR: Reinforcement Learning with Verifiable Rewards)によって支配されていますが、それが適用されるドメインは基本的な質問応答のチェックから複雑な環境へと劇的に変化しています。
私たちが目撃しているのは、クローズドなフロンティアラボが、現在の焦点(つまりコードやターミナルタスクなど)の習得に驚くべき額の資金を投じており、より多様なナレッジワータスクへの展開を開始しているという事実です。これらの新しいタスクには、会計、法律、医療などの専門分野が含まれます。これらは依然としてエージェント型ですが、より高度な専門知識を必要とし、既存のソフトウェアやドメイン固有のツールとの統合を頻繁に要求します。
これらの新しいドメインにおける真の能力バランスに関する証拠は非常に限られていますが、オープンモデルが追いつくのが困難になると私が言う際に焦点を当てている領域はこれらです。問題は、複雑な言語モデルワークフローの評価自体も、困難な研究課題であることです。
タスクはより複雑になり、それらに対してヒルクライム(局所最適化)するために必要なデータは、よりプライベートなものになりつつあります(GitHubに膨大なコードが存在するコードとは対照的です)。主要なオープンモデルラボを支援しているのは、データ業界で起きているダイナミクスであり、これはチップファブ(半導体工場)を構築する経済的動態に似ています。米国にある数少ない主要ラボは、新しい環境やデータセットを購入するために天文学的な金額を支払いますが、その後を追うラボ(多くは中国にある)は、これらのものを大幅な割引で購入します。
これは重要な見落とし点です——非フロンティアラボが追いつくために使用するレバーは、時間とともに絶えず変化するという点です。中国のモデルの進歩における主要なレバーとして蒸留(distillation)に焦点を当てることは、現在のトレーニングレジームにおいて強化学習環境(RL environments)の重要性を見落としている盲点に他なりません。もし評価環境が、Artificial Analysis Index における単一の評価として構築できる場合、あるいはそれを模倣するものであれば、現在のところ中国のラボは追いつくことができるでしょう。
Interconnects AI は読者支援型の出版物です。購読をご検討ください。
「フロンティア」を再発明するための経済的圧力
ここで検討すべき重要な質問は、OpenAI や Anthropic が主要なオープンウェイトモデル(さらには Google 系でさえも)に対して圧倒的なビジネス採用上の優位性を持つ、現在のタスクセット(再び、コーディングおよびターミナルタスク)が、収益数を維持するためにどれほど重要かということです。これらの記録的な成長数と軌道を維持するためには、パフォーマンスにおける意味のある優位性が継続的に存在し続ける必要があります。もしより安価なオープンモデルの同等品に置き換えることができるのであれば、多くの企業はトークン支出コストを削減したいと願うでしょう。
エージェント型コーディング能力が飽和し、AI パフォーマンスの「フロンティア」が他の領域へ移動した場合、エンタープライズ収益の大部分は、モデルが飛躍的に優れていることではなく、確立された顧客関係、慣性(インシャーシア)、およびより優れた製品開発に依存することになる可能性があります。
この不安定な立場こそが、私が「フロンティアラボは自らの存在意義を常に再発明し続けなければならない」と記述するものであり、AIインフラの広範な整備(buildout)を収益化することにおける分野全体の展望でもあります。私は依然として、この整備は価値があるという立場に立ち、AnthropicとOpenAIは天文学的な利益を生む企業になるだろうと考えています。したがって、私はこれを、両社がモデルに対して魅力的で新しい、価値のあるユースケースを継続的に解き明かしていくという信念と、オープンモデルが近づいているベンチマークが完全な指標ではないという見解の混合体として捉えています。
私は、中国の主要なオープンモデルは、米国の主要なクローズドラボよりもベンチマークにやや焦点を当てているという前提で行動しています。彼らにはそのようにするインセンティブがあります——彼らは、常に最高のクローズドモデルの足元を追っているという印象を与えたいのです。中国のラボが、ベンチマークへの過剰適合(overfitting)のみがこの物語に含まれていると主張することは、非常に無邪気で誤りです。彼らのモデルは本当に強力であり、過大評価と実際の革新の間のこのダイナミクスは、微妙なバランスの上に成り立っています。
WeirdMLやARC AGI 2のような分布外(out-of-distribution)ベンチマークでは、オープンウェイトモデルが大幅に劣位にあるケースがいくつか存在しますが、これらのオープンモデルが予期せず強力であることを示す無数のランダムなベンチマークも存在します。実際にモデルを使用すると、こうした堅牢性の欠如(例えば、ロングコンテキスト能力の不足や、ClaudeやCodexよりも頻繁にエージェントのコンテキストをリセットする必要があることなど)が把握できますが、それらが根本的に異なるカテゴリのモデルであるという意味でのカテゴリーエラーではありません。実際には、多くの人が予想していたよりもはるかに近い存在です。
オープンモデルはどれくらいの期間、追いついていけるのか?
続きを読む
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み