動画記事 · AI Engineer
Google DeepMind、全対象向け大規模エージェント評価を提案
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Google DeepMind は、AI エージェント評価の散在化と非透明性を解決するため、誰でも参加可能なハッカソン、標準化されたエージェント試験、ゲームアリーナ、オープンソースベンチマークプラットフォームを提案する。
Google DeepMind が提唱する「民主化された AI エージェント評価」の未来:ベンチマークの破綻と新解決策
現在の AI ベンチマークは、日次で大量に登場し維持が困難な状態にあります。評価手法の不透明さや専門家による偏りが深刻化する中、Google DeepMind は一般開発者も参加できる「標準化エージェント試験」やモデル同士の対戦形式である「ゲームアリーナ」、そして誰でもベンチメントを作成・共有できるプラットフォームを提案しています。
この発表は、AI エージェントの評価基準を大企業や研究機関の独占から解放し、下水処理場エンジニアのような一般ユーザーが作成した独自データセットを活用することで、AI の公平性と実社会への貢献度を高める重要な一歩となります。
崩壊しつつある「ベンチマーク」の現状
現在の AI 評価環境には、3 つの決定的な問題があります。まず、ベンチメントが散在し、すぐに陳腐化してしまう点です。毎日 10 件以上も新しいベンチメントが登場しますが、それらをすべて追跡するのは不可能に近く、論文が出版された直後にリーダーボードはすでに古びてしまいます。
「多くの研究者は次のベンチメントへと移りたがるだけです。結果として、これらのリーダーボードは時が経つにつれて関連性を失います」
2 つ目の問題は、評価手法の不透明さです。モデル発表元のノートやチャートを見る限りでは、ベンチメントがどのように設定され、実施されているかが不明確なケースが多発しています。
ある事例では、競合する AI ラボが「公開されたベンチメントの結果に満足できない」と指摘し、独自で再実行しました。その結果、自社のモデル向けに最適化された API 経由のコンパクションを使用していたため、はるかに優れたスコアを叩き出したのです。
「ご覧の結果は必ずしも現状を反映しているわけではなく、これは問題です」
3 つ目は、評価プロセスへの参加者が極端に限定されている点です。AI は人類の大半を支援するはずですが、実際には約 3 万人の AI 研究者や数千万人の技術者という極めて狭い層が中心となっています。
「AI が人類の大半を助けることを期待しながらも、その評価を生み出しているのは人類のごく一部です。これが公平な AI ではありません」
この偏りは、一部の分野では超人的知能が現れる一方、他の分野では平凡な性能に留まるという「認知の端や不整然さ」を招いています。
「下水処理場エンジニア」が語る、実社会の真実
専門家の視点だけではカバーしきれない領域こそ、AI の真価を試す場所です。DeepMind が紹介した興味深い事例に、トルコ在住の下水処理場エンジニアの話があります。
彼は 20 年間この分野で働き、安全プロトコルを無視した事故により人々が命を落とした現場を目撃しました。そこで彼は、AI が自身の業務をどのように支援し、将来の事故を防げるかを評価するための独自ベンチメントを構築しました。
「これは彼が自身の経験から作成した非公開のデータセットで、ウェブ上のどこにも存在せず、どの AI ラボの研究対象領域にも含まれていません」
このデータセットは、AI ラボが重点的に取り組んでいない「経済的に生産的な瞬間」や、実社会の安全プロトコルに関する重要な課題を扱っています。専門家のみならず、特定の業界で働く一般ユーザーこそが、AI の真の実用性と安全性を測る鍵を握っているのです。
3 つの解決策:民主化へのアプローチ
これらの課題に対し、Google DeepMind と Kaggle は以下の 3 つのアプローチで解決を図っています。
1. ハッカソンによるエネルギーの方向付け
ハッカソンは、人々の創造的なエネルギーを特定の課題に集中させる強力な手段です。過去 3 年間のジェミニの実現に向けた動きのように、適切なガードレールと十分な創造の余地を与えれば、限られたリソースでも大きな成果を生み出せます。
DeepMind の AGI チームは、認知能力の測定方法について論文を発表した直後にハッカソンを開始。10 個の能力のうち特定の 5 つに焦点を当て、誰もが AI 研究へ貢献できる場を作りました。
「各 AI ラボが独自に行えない独自の貢献があることを認識し、誰もが何かを貢献できると考えています」
参加者には API キーやデータセットへのアクセス権を提供し、経済的な格差による参入障壁を取り除く仕組みも整えています。すべての成果はオープンソースとして共有され、限られた人だけでなく全ての人にとって利益となるように設計されています。
2. 標準化エージェント試験(SATs)の民主化
「標準化エージェント試験」は、AI エージェントを世界に送り出す前に安全性の基本値を確認するための簡易テストです。当初は SATs と名付けられていましたが、商標の問題により名称を変更しました。
仕組みはシンプルで、ワンラインのプロンプトを送信し、リーダーボード上でスコアを返すだけです。この試験の重要性は、評価プロセスの両極端にある「最先端技術を用いる研究機関」と「実世界への展開前にテストしていないオープンクローラ構築者」をつなぐ点にあります。
「エージェントを世界に送り出す前に、その安全性の基本値を素早く確認できるような、安全重視の試験をどうすればもっと実施できるかという点が重要です」
難しすぎれば誰も完了できず、簡単すぎれば適切なシグナルが得られません。このバランスを取りながら、すでに 500 人以上のエージェントがこの試験で評価済みです。
3. ゲームアリーナとオープンベンチメントプラットフォーム
既存のベンチメントはすぐに飽和してしまいます。そこで提案されたのが「ゲームアリーナ」です。これはモデル同士が PVP(プレイヤー対プレイヤー)で対戦する形式で、ELO ランキング方式を採用しています。
「決して飽和することはありません。互いに戦い続け、勝者と敗者が必ず決まるからです」
狼人狼ゲームやポーカーなど、欺瞞能力やリスク管理を分析できる多様なゲームが用意されています。最新世代のモデルがポーカーでリスク回避的になっている傾向など、モデル同士の対戦を通じてしか見えない性格の違いも浮き彫りになります。
また、誰でも評価を構築・実行・共有できるオープンソースプラットフォームも提供しています。GitHub や Kaggle で全プロセスを公開し、コミュニティ主導でベンチメントを発展させる仕組みを構築中なのです。
まとめ
Google DeepMind が提唱するこの新しい評価体系は、AI エージェントの評価基準を大企業や研究機関の独占から解放し、一般開発者や特定業界の専門家が参加する民主的なプロセスへと転換させる可能性を秘めています。これにより、特定のモデルに最適化された評価ではなく、多様なユースケースにおける AI の真の実用性と安全性がより正確に測定され、社会全体への AI 導入の信頼性が向上すると期待されます。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。