動画記事 · No Priors: AI, Machine Learning, Tech, & Startups
OpenAI 研究員が明かす:現代 AI モデルで伝統的ベンチマークが機能しない理由
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
OpenAI のノア・ブラウンが、現代の AI モデル評価における「テスト時間計算量」の欠如を指摘し、ベンチマークのあり方と推論コストの重要性を説く。
OpenAI 研究員が明かす:なぜ「固定されたベンチマーク」は現代 AI の真価を測れないのか
OpenAI 研究員のノア・ブラウン氏は、現在の AI モデル評価において決定的な欠陥があると指摘します。従来のベンチマークはモデルの能力を「固定値」として扱っていますが、現代の AI は投入する計算資源(時間やコスト)に応じて性能が劇的に変動するため、単一の数値で比較することはもはや不可能です。
この議論は、AI 業界が「いかに速くモデルをリリースするか」から、「いかに正確な評価基準で真の能力を示すか」へとシフトする転換点となります。計算コストと性能の関係を可視化しない限り、過剰な期待や誤った比較による市場混乱を防ぐことはできません。
固定値としての「能力」はもう存在しない
現在の AI ベンチマークが抱える最大の問題は、モデルの能力を投入するリソース量に関係なく一定のものとして扱っている点です。GPT-3 の時代であれば、テスト時間の計算リソースを増やしても性能は大きく向上しませんでした。しかし、現代のモデルでは状況が全く異なります。
「予算を 10,000 ドル与えれば、10 ドルの場合よりもはるかに多くのことができます。1,000 万ドルの予算を与えれば、さらに多くを達成できます。」
つまり、モデルの能力は「投入する金額の関数」となっています。ベンチマークで「5.4 と 5.5 のどちらが優れているか」を比較する際、もし両者に異なる計算予算(思考時間やトークン数)を与えて評価すれば、結果は全く変わります。
実際、OpenAI が GPT-5.5 をリリースした際、多くの研究者がベンチマークの数値だけを見て「劇的な改善はない」と懐疑的でした。しかし、実際にモデルを動かして試すと、その性能の差は歴然としていました。GPT-5.4 は最大設定まで長く思考する必要がある一方、GPT-5.5 は非常に効率的に思考し、同等の結果を出しています。
ベンチマークが誤った比較を生んでいるのは、「テスト時間の計算量」を統制していないからです。同じ長さで考えさせるべきモデルに対して、異なる時間を与えて評価している現状では、公平な比較は不可能なのです。
「頭打ち」の先送り:数万トークンを超えても性能は向上し続ける
従来の AI 評価では、「パフォーマンスが頭打ちになるまで思考させれば十分」という前提がありました。しかし、現代のモデルはこの「頭打ち点」を遥かに超える領域で動作しています。
「5.5 や他のモデルが、適切に支援されれば数週間も思考を継続できます。そして一部のベンチマークで性能が頭打ちになるまでにはまだ時間がかかります。」
サイバーセキュリティや数学的な推論タスクなどでは、1 億トークンを超えても性能は改善し続けています。これは不連続なジャンプではなく、明確な傾斜として現れます。
もし「頭打ちになるまで」を基準に評価しようとすれば、現実的なテスト時間(数分や数時間)では到底到達できません。そのため、現在のベンチマークはモデルの真の能力を過小評価しているか、あるいは特定の予算範囲内での性能しか反映していないことになります。
解決策:計算コストを軸にした新しい評価基準へ
ブラウン氏が提案するのは、ベンチマークに「計算予算(トークン数、時間、コスト)」という軸を追加することです。これにより、モデル間の比較がはるかに明確になります。
具体的なアプローチとしては以下の二つが考えられます。
- 予算制限の明示: ベンチマークで使用するトークン数や時間を厳格に定義し、「この予算内でどれだけの性能が出せるか」を評価する。
- プロットによる可視化: モデルに投入される計算コスト(X 軸)に対する性能(Y 軸)をグラフ化し、スケーリング曲線として比較する。
例えば、10 ドルの予算と 1,000 ドルの予算でそれぞれモデルがどう振る舞うかを測定し、そこから「1 万ドルの予算ではどれほどの性能を発揮するか」を予測するモデルも必要です。これは現在、研究が十分に進んでいない分野であり、多くの研究者にとって新たな課題となっています。
ルーティング層やアンサンブル手法も「コスト対効果」で評価すべき
近年注目されている「ルーティング層(複数のモデルを状況に応じて使い分ける)」や「アンサンブル手法(複数回実行して最良の回答を選ぶ)」についても、ブラウン氏は注意を促しています。
これらの手法は、単一モデルが長時間思考するのと本質的に同じです。例えば、5 回実行して最良のものを選ぶことは、計算コストを 5 倍にしているに過ぎません。
「ルーティング層やアンサンブル手法も、最終的には『計算コスト対性能』で単一モデルの長時間思考と比較されるべきであり、別次元の評価ではない。」
紙面上ではスコアが向上しても、実質的に投入したリソースが増えているだけなら、それは「ベンチマークの最大化」に過ぎません。真の能力評価には、これらの手法を含めた総計算コストを考慮する必要があります。
安全性評価における「予算」の欠落という危険性
この議論は、モデルの性能だけでなく、安全性評価にも重大な影響を及ぼします。
多くの AI ラボでは、「責任あるスケーリングポリシー」に基づき、モデルが生物兵器の製造や悪意ある行為に利用できないかを確認しています。しかし、これらの評価プロセスもまた、テスト時間計算のスケーリングを十分に考慮していません。
「GPT-3 の時代にはテスト時間の計算リソースをスケールできませんでした。しかし現在、モデルの能力は投入する資金量の関数として決まります。」
もしモデルが低予算では危険な行為ができなくても、無限に近い予算を与えれば実行可能になる可能性があります。現在の評価フレームワークでは、この「高予算下でのリスク」を十分にテストできていないのです。
社会が望まないタスクであっても、十分な計算資源があれば実行できる可能性があり、そのためのテストや予算設定がモデルのリリースサイクルと整合していない現状は、大きな懸念材料です。
結論:評価基準の再構築が実用 AI の道筋を開く
OpenAI の研究員が指摘する問題は、単なるベンチマークの数値論争ではありません。これは、「モデルをいかに正確に評価し、リソースをどう配分すべきか」という根本的な問いです。
現在の業界は、2〜3 ヶ月ごとに新しいモデルをリリースする競争に追われており、各モデルの能力上限(例えば数週間や数ヶ月かけて到達する性能)を完全に検証する時間を持っていません。その結果、潜在的な能力やリスクが見過ごされる可能性があります。
「真の評価を行う唯一の方法は、モデルのリリースサイクルを遅らせることしかありません。しかし現在、それをしないよう競争圧力が非常に強まっているのです。」
AI 開発者や研究者は、固定されたベンチマーク結果に惑わされず、計算コストと性能の関係を可視化する新しい基準を採用する必要があります。これこそが、過剰な期待を排し、実用的で安全な AI エージェント開発への確かな道筋となるのです。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。