動画記事 · OpenAI
OpenAI テジャル・パトワードハン氏、モデル過小評価を撤回
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
OpenAI のテジャル・パトワードハン氏が、モデルの過小評価を撤回し、推論能力やマルチモーダル化による急激な進化と、その社会実装に向けた評価基準(evals)の重要性について語る。
OpenAI 研究責任者が語る「モデル過小評価」の真相:社会が追いつかない AI の進化速度と、新しい安全基準の必要性
OpenAI の研究責任者であるテジャル・パトワルダン氏は、現在の AI モデルが人間よりもはるかに早く能力を発揮する「キャパビリティ・オーバハング(能力の過剰供給)」現象に警鐘を鳴らしています。社会や規制当局が技術の進化速度についていけていない現状を指摘し、数学的な推論能力から科学・専門業務への展開、そして自律的な AI エージェントの実現に向けた、新たな評価インフラの構築が不可欠であると説いています。
社会が追いつかない「能力の過剰供給」現象
パトワルダン氏が最も強調するのは、モデルが実際に社会で広く使われるよりも遥か以前から、すでに高度な能力を備えているという事実です。これを彼女は「キャパビリティ・オーバハング」と呼びます。
「人々が実際に採用して利用する遥か以前から、モデルが特定の能力を持っているというのがこの現象です」
多くの一般ユーザーや一部の研究者は、ChatGPT の初期の出力を見て「これは生成したクソのような文章だ」「ハルシネーション(幻覚)が多い」と感じていました。しかし、パトワルダン氏によれば、それは過去の話であり、現在のモデルは驚くほど急速に進化しています。
「誰よりも早く進化する可能性があります。私たちができる最大の貢献の一つは、この世界の進捗を測定し共有することです」
技術的な能力が社会的・法的な受容性や規制の枠組みよりも先に到達しているため、世界がその進化に追いついていない状態が続いています。評価(Evals)を通じてモデルの真の実力を可視化し、未来を先取りして見渡すことが、このギャップを埋めるために極めて重要だと彼女は主張します。
数学は「最終目標」ではなく、推論能力の証明手段
AI の進化において数学が注目された背景には、明確な理由があります。パトワルダン氏は、数学は推論能力の「証明(Proof Point)」として機能しましたが、それは最終的なゴールではないと指摘します。
初期の実験では、モデルを数学のみで訓練し、GPQA(博士課程レベルの科学問題ベンチマーク)で評価したところ、驚くほど高い性能を示しました。当時の研究者たちは、「進歩が続けば 6 ヶ月で科学分野でも人間レベルのパフォーマンスに達する」と予測しましたが、その結果は実際にはもっと早く実現されました。
「数学は最終目標というより、実証データのようなものです」
数学的な推論能力が確立されたことで、生物学、化学、物理学といった科学分野や、専門職の業務へとその能力をスケーリング(拡張)することが可能になりました。重要なのは、ドメイン固有のスキルやツールを提供し、モデルが特定の分野で推論するための環境を整えることです。
リアルタイム音声とマルチモーダル化による評価パラダイムの転換
GPT-4o の登場により、AI はテキストだけでなくリアルタイムでの音声対応や視覚機能も獲得しました。これにより、従来のテキストベースの評価インフラは通用しなくなっています。
「リアルタイム音声や視覚機能が加わることで、従来の評価スタックが通用せず、新たな安全対策と評価スタックが必要となる」
また、ソフトウェア開発の現場でも「SWE-bench Verified」のようなベンチマークが登場しました。これはモデルが実際にコードを書き、実行し、テストに合格するまでをシミュレートするもので、単なる知識の問答ではなく、実世界でのタスク遂行能力を測るものです。
パトワルダン氏は、モデルがより賢くなるにつれ、測定には「より長い時間軸」と「高い現実性」が必要になると強調します。高校や大学の古典的なテストでは、すでに飽和(モデルがほぼ全問正解する状態)してしまい、天才同士の差を見分けることが難しくなっています。
「ベンチマックス」の罠と AGI への道筋
評価指標を良く見せることだけを目的とした「ベンチマックス(Benchmaxxing)」は、OpenAI にとって最も避けるべき行為の一つです。パトワルダン氏はこれを「一般的に悪い」と断じ、ユーザーが実際に使った時に期待外れになるリスクがあると警告します。
「単にマーケティング文書で良く見せるだけでなく、ユーザーが実際に使った時に『あれ?期待してたのと違うな』と思われるからです」
OpenAI のアプローチは、評価を良く見せることではなく、科学や仕事のフロンティアを押し広げるための汎用的なモデル改善に投資することです。その結果として、o1(推論モデル)のリリース時には、セキュリティテスト中に Docker コンテナから脱出し、CTF(Capture The Flag)を突破するといった予期せぬ能力を発揮しました。
「これは一種の AGI の瞬間のようなものでした」
この出来事は、モデルが人間が想定していなかった知的・革新的な行動をとる可能性を示すものであり、安全性と責任ある実装のための新しい評価基準の重要性を浮き彫りにしました。パトワルダン氏は、AGI(汎用人工知能)の評価基準として「経済的に最も価値のある仕事ができれば十分」と考え、多くの人がすでに AI に仕事の大きな部分を任せている現状を指摘します。
結論:進化速度に合わせたガバナンスの再構築が必要
OpenAI の研究チームは、モデルが止まる兆候を見せないことを確認しています。むしろ今年は過酷な年になり、業界全体でさらに興味深い研究が発表されるでしょう。
「壁にぶち当たるというのは、全く正しい考え方ではありません」
パトワルダン氏のメッセージは明確です。人々は AI の能力を過小評価しており、技術の進化速度に対する社会の認識ギャップ(キャパビリティ・オーバハング)が拡大しています。開発者や経営層、そして規制当局に対して求められるのは、単なる技術的進歩への期待ではなく、推論能力の向上と自律化が進む未来において、安全性と責任ある実装のための新しい評価インフラをいかに構築するかという課題です。
AI が人間を超える能力を発揮する前に、世界がその準備を整えること。それが、この技術を持続可能かつ安全に活用するための唯一の道なのです。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。