frontier AI 能力を測定するオープンワールド評価
本文の状態
日本語全文を表示中
詳細モードで約23分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
AI Snake Oil
研究者らは、主要ベンチマークが飽和した現在、AI が実製品開発や科学実験など現実世界でどのように機能するかを評価する「オープンワールド評価」を導入した。この論文は、その定義と手法について詳述している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
この投稿は8,000語に及び、新興タイプのAI評価に関する私たちの新しい共同論文です。この論文は、ここではPDF形式でも公開されています。
要約:AIモデルは主要なベンチマークのほとんどを飽和させ始めています。しかし、それは現実的な製品を開発・リリースできるか、科学実験をエンドツーエンドで実行できるか、あるいは政府の官僚機構をナビゲートできることを意味するのでしょうか?研究者たちは、このような現実的な環境でAIをテストし始めています。私たちはこれらの評価を「オープンワールド評価」と呼んでいます。このエッセイでは、オープンワールド評価の定義、これまでに得られた教訓の調査、およびそれらを実施するためのベストプラクティスの提示を行います。
また、学術界、政府、市民社会、業界から17人の研究者による協力団体「CRUX」を紹介しています。この団体は、オープンワールド評価を通じて最先端のAI能力を定期的に評価します。私たちの最初の試みでは、AIエージェントがiOSアプリを開発しApp Storeに公開しました。その際、2つのエラーが発生しましたが、そのうち1つは手動での介入を必要としました。これは有用な能力の潜在的な兆候を示す初期の指標であり、さらに重要なのは、AI駆動型App Storeスパムの可能性に関する早期警報でもあります(この結果は公開の1ヶ月前にAppleに開示しました)。
私たちは、他の現実的なドメイン全体にわたって早期警報を浮上させるために同様の実験を実施することを目指しています。これが、今後1年間の私たちの主要な実証プロジェクトの一つとなります。
著者は以下の通りです:Sayash Kapoor, Peter Kirgis, Andrew Schwartz, Stephan Rabanser, J.J. Allaire, Rishi Bommasani, Magda Dubois, Gillian Hadfield, Andy Hall, Sara Hooker, Seth Lazar, Steve Newman, Dimitris Papailiopoulos, Shoshannah Tekofsky, Helen Toner, Cozmin Ududec, Arvind Narayanan
AIの能力をどのように追跡し、予測すべきでしょうか?現在、AIコミュニティにおける支配的な回答はベンチマークです。例えば、METRのタイムホライズングラフは、政策アナリスト、業界リーダー、およびAIリスクを研究する組織によって、AIの能力が急速に増加していることを示す証拠として使用されてきました。
しかし、ベンチマークは進歩を過大評価することもあれば、過小評価することもあります。あるタスクをベンチマークにするためには、それが正確に指定され、自動的に検証可能である必要があります。ここで重要なのは、ベンチマークに十分な精度を持つものは、最適化の対象としても十分精度高く、AIエージェントがそのようなタスクで優れた成果を上げられる可能性があるという点です。逆説的に言えば、ベンチマークでの精度が低い場合でも、ウェブサイト上のCAPTCHA(ロボット判定テスト)に遭遇するなどといった偶発的な失敗によるものであり、エージェントが根本的なタスクを解決する能力を持っている可能性もあります。
これらの限界に対処するため、多くの研究者がベンチマークを超えた、長く不規則で現実的な評価である新しい種類の評価に注目しています。AnthropicのNicholas Carliniは、Claudeエージェントを使用してLinuxカーネルをコンパイルできるCコンパイラを構築しました。AnthropicとAndon Labsは、Claudeにオフィス内の小さな店舗の運営を任せる自由形式の実験を設計しました。ベンチマークは自動化された方法で評価される数十のタスクから成りますが、オープンワールド評価(open-world evaluations)は小規模なサンプルで構成され、多くの場合人間の介入を必要とし、エージェントのログ分析などによって開かれた方法で評価されます。
これらを非科学的として片付けるのは容易です。各評価はサンプルサイズが1であり、標準化や再現性が欠如しているからです。これらの限界にもかかわらず、私たちはAIの能力に関する証拠を収集する上でこのような評価が重要であると信じています。これらは、社会的レジリエンス(resilience)の構築に向けた取り組みに情報を提供するために、新たな能力の出現に関する早期警告を提供し、評価者が既存のベンチマークにおける盲点を特定するのを助け、また企業に対してAIシステムが間もなく実行しうるタスクのより明確な像を提供し、AIに関する戦略的意思決定に役立ちます。私たちはこれらをオープンワールド評価と呼びます。
本エッセイでは、オープンワールド評価の概念を整理し、それらの実施におけるベストプラクティスと落とし穴を特定するために過去の例を検証し、新しいオープンワールド評価を定期的に実施することを目的としたプロジェクトCRUXを紹介します。以下が私たちの主な洞察です。
オープンワールド評価は、AI評価の重要な新興カテゴリです。AIシステムが高度化するにつれて、最先端の能力を引き出すための評価も複雑さを増さなければなりません。オープンワールド評価は、増加する複雑さを持つ一連の評価における最新のものと言えます。私たちは過去1年間に実施された10件の主要なオープンワールド評価を調査し、ベストプラクティスと重要な教訓を特定しました。
CRUX(Collaborative Research for Updating AI eXpectations:AI期待の更新のための共同研究)は、オープンワールド評価を体系的に実施しようとする私たちの試みです。チームには政府、学界、非営利団体からの協力者が含まれており、その多くはオープンワールド評価を主導してきた経験を持ち、AIの未来に対して多様な見解を持っています。私たちは現在のコストがかかっても構わないため、AIシステムの現在の能力に関する実証証拠を提供し、まもなく普及する可能性のある能力に対する早期警告を発することを目指しています。私たちは定期的に新しいオープンワールド評価を公開する予定です。
最初のCRUX実験では、AIエージェントにiOSアプリを開発し、App Storeに公開するタスクを課しました。多くのベンチマークはエージェントのコード記述能力を試すものですが、iOSアプリの公開には署名やプライバシーポリシーをウェブページに掲載すること、Appleのフォームへの入力、そして審査プロセスを通すなど、他の多くのステップが含まれます。私たちはエージェントがコードを書く能力よりも、アプリを公開するという現実世界の要件を満たすことに成功したかどうかに関心があったため、シンプルなアプリの構築とiOS App Storeへの提出プロセスを完了させるタスクを与えました。
エージェントは2つのエラーを犯した後、成功しました。そのうち1つは手動での介入が必要でした(正しい認証情報の保存場所を忘れたこと、およびApp Storeの審査プロセスのために架空の電話番号を作成したことです)。このアプリの開発と公開には約1,000ドルのコストがかかりました。現在、このアプリはiOS App Storeで公開されています。私たちはコストをさらに大幅に削減できたと考えています:アプリの開発と提出にはわずか25ドルしかかかりませんでした。トークンの大部分はアプリのステータス監視に費やされました。私たちはこの論文の公開1ヶ月前にAppleに連絡し、実験の結果を開示しました。App Storeの運営者は、エージェントを使用して自律的に提出される数千件のアプリケーションが間もなく殺到する可能性があるため、スパム提出への備えと監視を準備する必要があります。
オープンワールド評価をどのように改善できるか?次なるステップは何か?オープンワールド評価の有用性を高めるために、評価者は人間の介入が許可される範囲と量を明確にし、エージェントがタスクを解決する際に収集したログを公開し、そのログを分析してエージェントがタスク解決の過程で何を行ったかを報告すべきである。今後の CRUXes では、AI 研究開発(R&D)の自動化、AI ガバナンス、およびその他の多くの領域を評価する予定である。
オープンワールド評価は、重要な新興の AI 評価カテゴリーである
このセクションでは、オープンワールド評価を定義し、そのような評価の新興する状況を検証して、その成功と限界に関する洞察を引き出す。ベンチマークのいくつかの盲点を克服できるオープンワールド評価の可能性のある領域について議論する。私たちの見解では、AI システムがより高度になるにつれて、最先端の能力を引き出すための評価はより複雑化する必要があり、オープンワールド評価は、複雑さが増す一連の評価における最新のものである。また、ベンチマークと比較したオープンワールド評価の限界についても議論する。
以下に、オープンワールド評価を定義する5つの緩やかな基準について議論します(「オープンワールド評価とは?」参照)。ただし、長期かつ複雑なベンチマークタスクとオープンワールド評価の境界は曖昧であることに留意する価値があります。実際、私たちが議論している多くの評価はサンドボックス化されています。それでも、これらをオープンワールド評価のリストに含めています。なぜなら、他の基準を満たしているからです(例:Carlini氏のCコンパイラはサンドボックス化されていますが、評価の一部として単一の長時間実行タスク、人間の介入、および定性的分析を伴います)。
ベンチマークは進歩を過大評価も過小評価もする
AIに関する見解が極端に異なる人々でも、現在のAIベンチマークはまもなく飽和状態に達する可能性があることに同意しています。多くの主要なベンチマークは過去2年間で飽和しており、評価者は「後継」ベンチマークの公開を競ってきました。これらの更新されたベンチマークの多くも、すでに飽和に近い状態にあります。

多くの人気のあるベンチマーク(SWE-Bench、ARC-AGI、τ-bench、Terminal Bench、METRのTime Horizonタスクスイートなど)では、過去2年間で後継ベンチマークが公開されています。
これは、AI システムがまもなくあらゆるタスクを解決できるようになることを意味するのでしょうか。必ずしもそうではありません。ベンチマークの改善は実際の能力向上を示す可能性がありますが、進歩を過大評価することもあります。例えば、ベンチマークには構成妥当性の限界があり、特定のタスクに対する正確さをテストしているだけで、一般的な能力を評価していない場合があるためです。また、エージェントが現実世界の環境の複雑さや不確実性をどの程度処理できるかをテストしていません。
その逆のケースとして、測定されている能力とは本質的に関連しない環境やインフラストラクチャ上の課題(例えば CAPTCHA の出現など)により、ベンチマークが進歩を過小評価することもあります。
より包括的な状況把握を得るための一つの方法は、正確性以外の指標を使用することです。例えば、最近共同で執筆したプレプリントにおいて、私たちはエージェントが能力指標(平均正確性など)の観点からは劇的に改善している一方で、信頼性を測定する指標における改善は著しく遅れていることを示しました。同様に、テストをパスしたために正解とみなされた SWE-bench 課題に対する多くのエージェントソリューションは、プロジェクトのメンテナーによって却下されることになります。
しかし、これでは依然として AI 能力の上限を測定することはできません。今日可能である能力(有利な条件下でのみであっても)は、まもなく広く普及する可能性があります。私たちはその普及に先立ってそれを見通す必要があります。このような早期警告を提供することで、企業には新しい機会を活用するための追加の時間を与え、機関にはレジリエンス(回復力)を構築する時間を提供し、政策立案者にはリスクに対処する猶予を与えることができます。
では、ベンチマークが能力を過大評価し、かつ過小評価する理由についてより詳しく議論しましょう。ベンチマークが能力を過大評価する理由は以下の通りです。
ベンチマークは、現代の強化学習(Reinforcement Learning: RL)技術に適したタスクに類似しています。あるタスクをベンチマークにするには、それを正確に指定し、自動的に検証可能にする必要があります。しかし、ベンチマークとして測定できるほど精密なものは、最適化の対象としても十分精密であり、現代の RL トレーニングの実行はベンチマーク自体の形状にますます似通ってきています。これにより、ベンチマークを用いて測定可能なあらゆるタスクを飽和させることが容易になります。
これは、RL トレーニングプラットフォームとしても機能する Harbor などの主要な評価プラットフォームにおいて、すでに事実となっています。その結果、AI モデルはこれらのプラットフォームに含まれる多くの著名なベンチマークのデータから直接学習することができます。ベンチマークにホールドアウト(held-out)テストセットが含まれていても、モデルはテストセットで遭遇する可能性が高いタスクと非常に似通ったトレーニングセットのタスクから学習することがあります。したがって、ベンチマークは、パフォーマンスが現実世界にどのように一般化するかを理解するのに役立ちません。
ベンチマークは、現実世界の複雑さを避けます。現実のタスクには、予期せぬ状況への対応や、オープンエンドな環境でのナビゲーションなど、完全にサンドボックス化できない未定義の相互作用が含まれます。ベンチマークは複雑な環境をシミュレートするいくつかのステップを取ることができますが、それらを完全に複製することはできません。
ベンチマークが能力を過小評価する理由は以下の通りです。
最先端の能力を引き出すには多額の費用がかかる。大規模で長時間にわたる実験の実行は高価であり、ベンチマークが依存するサンプルサイズを達成するのは現実的ではない。AnthropicのCコンパイラの開発コストは約2万ドル、以下で詳述するタスク(CRUX #1のためのiOSアプリの開発と公開)の実行コストは約1,000ドルであった。このような実験を数百回実行することはできないため、各ベンチマークタスクの予算と複雑さに制限が生じる。
平均的なパフォーマンスは、上限能力を引き出すこととは大きく異なる。ベンチマークスイートで数十(あるいは数百)のタスクを実行するのは、平均的なパフォーマンスを測定するために必要である。しかし、エージェントが何を行えるかの最前線を理解しようとする場合、目的はベストケースのパフォーマンス、すなわち偶発的な失敗を回避するために十分なリソースと支援が与えられた場合にエージェントが達成し得ること、を理解することにシフトする。これは、まもなく広く普及する可能性のある能力に対する早期警告を提供するために必要である。
人間の介入は、能力の上限を引き出すのに役立つ可能性がある。現実世界のタスクに取り組むエージェントは、ポリシー拒否に直面したり、CAPTCHAの解決を必要としたり、または他のインフラストラクチャの問題に遭遇して立ち往生することがある。これらはパフォーマンスに悪影響を及ぼす可能性がある。しかし、これらの失敗は測定されている能力にとって偶発的なものに過ぎない。人間のオペレーターがこれらを処理できれば、能力の上限を引き出すことができる。このような手動介入は、実行されるたびに数百のベンチマークタスクに対しては現実的ではない。
AIの能力が向上するにつれて、コーディング、深層調査、カスタマーサービスにおけるAIの能力をテストするサンドボックス評価は、エージェントに挑戦し、汚染や報酬ハッキングを避けるために、非常に緻密に設計された環境を必要としています。例えば、エージェントのウェブベンチマークでのパフォーマンスは、エージェントがCAPTCHAに遭遇する頻度によって影響を受けており、エージェントの真の基礎能力を引き出すものではありません。最近の研究では、AIエージェントがオンラインで回答を見つけたり、評価のバグを悪用したり、テストはパスするものの生産環境の基準を満たさないコードを生成したりすることが指摘されています。これは、平均的なベンチマークスコアの洪水の中で失われがちな失敗モードや問題解決戦略をよりよく理解するのに役立つ、AIエージェントのパフォーマンスに対するより深い定性的評価への移行の必要性を浮き彫りにしています。
しかし、これらの妥当性への脅威は簡単に解決できるものではありません。ベンチマークに対して定性的なログ分析を行うことで、これらの懸念の一部に対処できますが、ログ分析を用いてベンチマーク結果に妥当性の問題を見つけたとしても、更新されたベンチマークをリリースする以外にできることはほとんどなく、それには数ヶ月かかる可能性があります。オープンワールド評価(open-world evals)により、実際のテストランの前に問題を修正するためのドライランを実施し、評価中に発見された問題を手動で修正することができます。1
もちろん、これらの限界があるにもかかわらず、ベンチマークは有用です。2 また、オープンワールド評価にも独自の限界があり、これについては本論文の後ほど議論します。とはいえ、このリストがベンチマークにおける体系的な盲点を浮き彫りにしていることを願っています。AI エージェントの能力が向上するにつれて、従来のベンチマークと現実世界の能力の間に特定されたギャップは拡大し続けます。成功指標は、特定のタスクにおける多様な目的を捉えるために多面的である必要がありまます。ベンチマークは、主要なボトルネック(人間の支援)や雑多な環境(インターネットナビゲーション)を組み込む必要があり、それぞれが内部および外部の有効性に関する追加の問題をもたらします。オープンワールド評価は代替案を提供します。
オープンワールド評価とは何ですか?
評価方法が AI の能力と並行して成熟するにつれて、評価のグラデーション(段階的な連続体)が出現しました。一端には、初期段階の能力に対してよく機能するシンプルで自動化可能かつスケーラブルな方法があります。他端には、能力が向上し単純な指標が行き詰まるようになると必要になる、より豊かで労働集約的な方法があります。
ある分野での能力が向上するにつれて、単純な評価と補完的な洞察を得るために、グラデーションのより先にある評価が重要になります。これまでのところ、このグラデーションは概ね5つのレベルに分かれると考えており、それぞれに強みと限界があります:
Q&A ベンチマーク(例:MMLU、GPQA)は広範な知識の評価に有用ですが、最先端モデルにとっては飽和状態になりつつあります。採点の容易さから複数選択問題として構成されることが多いものの、ユーザーがモデルと対話する際に複数選択問題を問うことは稀であるため、構成妥当性(コンストラクトバリデティ)が低いという結果を招いています。
オープンエンドのチャットベンチマーク(例:WildBench、Arena-hard-auto)はより微妙なニュアンスを捉えますが、依然として単一ターンまたは短い対話に限定されています。
成果のみを評価するエージェントベンチマーク(例:SWE-Bench、WebArena)は、実際のタスクにおけるエージェントのパフォーマンスをテストしますが、タスクがどのように完了されたかではなく、完了したかどうかのみを測定します。その結果、これらのベンチマークには限界があります。例えば、SWE-Bench で合格した解決策のほとんどはリポジトリのメンテナーによって承認されません。
ログ分析を伴うエージェントベンチマーク(例:UK AISI 転記分析、METR Time Horizon)は、エージェントがどのように成功または失敗するかを調査し、エージェントのログを分析してエラーや報酬ハッキング(レワード・ハッキング)を発見することで、より深い洞察を提供します。しかし、これらは依然として定義済みのタスクを持つサンドボックス環境で動作しています。
オープンワールド評価:成功を明確に指定したり自動採点したりできない、現実世界の環境における長期タスクです。これにより、能力の上限を引き出すことができます。ただし、これは再現性と標準化の欠如(これらはベンチマークの利点です。制限事項のセクションを参照)という代償を伴います。
このスペクトルのカテゴリを曖昧にする評価も存在します。例えば、OpenAI の GDPVal は長期のエージェントベンチマークであり、専門家の品質評価に基づいて手動で採点されるように設計されています。この構造はオープンワールド評価と非常に似ていますが、主に出力に焦点を当て、ログの分析には重点を置いていません。同時に、GDPVal の結果は一般的に GDPval-AA を用いて報告されますが、これは自動化された LLM による採点を使用します。この評価設定は、成果のみを対象とするエージェントベンチマークに似ています。
オープンワールド評価とは、現実の環境において少数の長期タスクに対してエージェントを実行し、ログ分析ツールを用いてその結果を定性的に評価することを指します。これらの評価はベンチマークと補完関係にあり、その多くの限界に対処するのに役立ちます。また、現在の AI システムが到達できないタスクを発見し、将来のベンチマーク作業のための対象となる可能性も示唆します。
オープンワールド評価の境界を明確にするため、大まかな分類体系を提供します。単一の次元だけで実験が「オープンワールド」に該当するかどうかが決まるわけではありません。代わりに、以下のすべての次元全体のパターンに基づいて判断されます。
開放性。この評価はサンドボックス環境ではなく、実際のデプロイメント設定で行われるものか?
複雑さ/長さ。このタスクは、数分や数時間ではなく、人間が数日または数週間をかけて完了する必要があるものか?
タスク数。これは単独のタスク、あるいは少数のタスクセットか(大規模な評価スイートやベンチマークではないか)?
人間の介入。能力の上限を引き出すために、エージェントが壁にぶつかった際に(単に環境を設定したりセットアップの問題を解決するだけでなく)、人間が介入できるかどうかが問われます。
評価方法。この評価は、単一の平均的な指標によって導き出される結果ではなく、詳細なログの評価を主眼としているかどうかが問われます。
エージェントを用いて何らかの新しいことを成し遂げるのと、単なる「評価」と呼ぶべきものの境界はどこにあるのでしょうか?例えば、AnthropicはAIエージェントを用いて、Mozilla Firefoxのような主要なオープンソースソフトウェアのセキュリティ脆弱性を発見しました。これはオープンワールド評価の例と言えるでしょうか?エージェントが行った部分と人間专家が行った部分、そして最終的な結果を含む、エージェントの役割が体系的かつ公に文書化されている場合、私たちはこれらを依然としてオープンワールド評価と見なします。
複雑なベンチマークタスクとオープンワールド評価の境界もまた曖昧です。例えば、以下のオープンワールド評価リストに含まれるいくつかの評価はサンドボックス化されています(例:Claude Plays PokemonとAnthropicのCコンパイラはどちらもサンドボックス環境で実行されましたが、これらは単一の複雑で長時間にわたるタスクから成り、評価中に人間の介入があり、定性的に評価されるため、私たちはこれらをオープンワールド評価と見なしています)。
この2種類の評価は補完関係にあります。エージェントが解決できないタスクを把握するためにオープンワールド評価を用い、それが新たなベンチマーク構築への第一歩となることを想定できます。また、オープンワールド評価を
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み