WANDR ベンチマーク:広域深層調査エージェントの評価
本文の状態
日本語全文を表示中
詳細モードで約19分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Perplexity AI は、広範かつ深掘りした調査タスクを評価するオープンベンチマーク「WANDR」を発表し、現状の最強システムでも性能が未熟であることを示した。
AI深層分析を開く2026年7月30日 18:28
AI深層分析
キーポイント
WANDR ベンチマークの公開
Perplexity AI は、知識労働における500 の現実的で挑戦的なデータ収集タスクに焦点を当てたオープンベンチマーク「WANDR」を発表した。
広さと深さの両立という課題
本ベンチマークは、多数の競合や企業情報を網羅的に発見する「Wide」と、各事象について証拠を裏付けるための詳細な調査を行う「Deep」の両方を評価対象とする。
現状の性能限界
Perplexity AI の評価によると、高負荷設定下でも最強のシステムはソフト F1 で 0.363、ハード F1 で 0.133 に留まり、広範かつ深掘りした調査はまだ解決されていない。
DRACO ベンチとの関係
WANDR は、単一の正確な長文レポート作成を問う「DRACO」ベンチの姉妹プロジェクトとして位置づけられ、前者が「広さ」に特化している点が異なる。
柔軟な資格キー階層構造
WANDR は company, employee, url のような階層的パス(例:company(n) → employee(m) → url(k))を定義し、各経路を独立して検証可能にする。この構造は単なるリストから複雑な行列や複数の証拠分岐まで、多様な検索タスクを表現できる。
重要な引用
WANDR is the wide sibling of our DRACO benchmark for deep research.
Even at a high effort setting, the strongest system in our evaluation reaches just 0.363 soft F1 and 0.133 hard F1.
Every complete path through the tree can be validated independently.
The same basic structure can represent a flat list, a nested search, a matrix, or a task with multiple evidence branches.
編集コメントを表示
編集コメント
Perplexity AI が公開した WANDR は、AI エージェントの実用化に向けた重要な指標となる。広範な情報収集と詳細な裏付けを同時に求めるタスクの難しさを浮き彫りにしており、今後の研究開発における重要な参照点となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
本日、私たちは「WANDR (Wide ANd Deep Research)」を公開します。これは知識労働における 500 の現実的で挑戦的なデータ収集タスクを中心に構築された、オープンなベンチマークおよび評価ハーンです。WANDR は、深層研究に特化した私たちの DRACO ベンチマーク の「広さ」を担う兄弟プロジェクトと言えます。
DRACO が「エージェントは正確で完全かつ客観的な長文レポートを作成できるか」と問うのに対し、WANDR は「大規模なコレクションを構築し、その構成要素すべてを具体的な証拠で裏付けられるか」を検証します。
これらは、すでに人間が研究用エージェントに任せている業務の典型例です。競合他社の分析、デューデリジェンス、文献レビュー、市場調査、製品比較、人材発掘などが含まれます。タスクの規模は数十件から数千件の独立して検証可能なレコードに及びます。私たちの評価において、最も強力なシステムでさえも、高負荷設定下では「ソフト F1」が 0.363、「ハード F1」が 0.133 に留まりました。広範かつ深層的な研究は、まだ解決すべき課題が残された領域です。

Expand
なぜ「広範かつ深掘り」型の研究が重要なのか
有用な調査タスクの多くは、エージェントが一つの答えを見つけただけで終わるわけではありません。市場アナリストであれば、条件を満たす競合他社をすべて特定し、それぞれの根拠となる証拠も揃える必要があります。デューデリジェンスチームの場合、数十社に及ぶ企業のリストに加え、各社の所有権構造、経営陣、資金調達状況、規制上のステータスまで詳細に把握することが求められます。
これにより、二つの異なる要件が生じます。
- 広範さ(Wide): 条件を満たす対象となるエンティティを、数多くかつ開かれた形で発見すること。
- 深掘り(Deep): 各エンティティについて、要求された主張を証拠で裏付けられる程度まで調査を深入りさせること。
この二つを組み合わせることで、問題の性質そのものが変化します。説得力のある事例が数件あるだけでは不十分ですし、不完全な調査に基づいて構築された洗練された物語も役に立ちません。エージェントは、記録ごとの事実上の正確さを損なうことなく、広範な発見活動を継続し続けなければなりません。
WANDR は、この構造を柔軟で組み合わせ可能な「資格キー階層(qualification key hierarchy)」によって捉えています。タスクでは以下のような形式が要求される場合があります。
company(n) → employee(m) → url(k)
これは、「条件を満たす n 社の企業」を見つけ、それぞれの企業に所属する「m 人の従業員」を特定し、さらに各従業員の情報を裏付ける「k ページの URL」を見つけることを意味します。ツリー内の完全なパスは、それぞれ独立して検証可能です。
この基本的な構造一つで、単なるフラットリストからネストされた検索、マトリックス形式、あるいは複数の証拠分岐を持つタスクまで表現できます。これらのパターンを組み合わせることで、一つの表現形式が現実世界の多様なユースケースをカバーできるようになります。

Expand
6 つの一般的な階層パターン
図中の塗りつぶされた円はエンティティ(実体)、点線の円は固定ラベル、四角形は URL リーフを表します。行列内では、重複する子ラベルは異なる親の下で同じ子値を示しています。
この構造を実践で示すタスクが 1 つ公開されています。
ceo_cfo_appointments(CEO・CFO の就任)
主要タスク
2026 年 3 月 1 日から 4 月 30 日の間に初めて発表された CEO または CFO の就任情報を、少なくとも 70 社以上の米国企業について見つけることです。各企業については、以下の条件を満たす権威ある就任ページを提供する必要があります。
- 企業と就任者を特定できること
- 役職と発表日付が明記されていること
- 発行者自身、公式提出書類、ニュースリリース、あるいは一次情報に基づく信頼性の高いビジネス報道から出典されたものであること
主要な階層構造
company(70) → company_appointee(1) → url(1)
企業一覧サブタスク
同じ 70 社について、米国証券取引所への上場記録、または米国国内に本拠を置く SEC(証券取引委員会)のExchange Act 報告発行体としてのステータスを示す、公認の上場権威ページを提供する必要があります。
サブタスクの階層構造
company(70) → url(1)
必要な記録数
合計 140 件(就任情報 70 件 + 上場情報 70 件)
すべてのパスは、評価者が再確認できるページと抜粋で終わります。共通の企業キーによって、就任情報と上場情報の両方の枝が紐付けられています。したがって、上場ステータスの別個の証明がない場合、その企業の情報は不完全とみなされます。
スケールして生成された現実的なタスク
WANDR ベンチマークは、合成されたプロンプトではなく、実際の運用環境で観察された匿名化されたパターンを起点としています。これにより、ベンチマークが人々が実際に委任する業務の性質——オープンエンドな調査、反復的な情報追加、複数ソースからの検証、そして専門レベルでの構造化比較——に密着した状態を保つことができます。半自動パイプラインがこのパターンを実際のタスクに変換し、人間の労力は徹底的な回答注釈付けではなく、品質管理に集中させることで最大化します。
このパイプラインは 4 つの段階で構成されています。シード(Seeding)では、再利用可能な広範囲調査のパターンとなるよう、匿名化された製品リクエストを抽出します。作成(Authoring)フェーズでは、作成者と批評家のループを交互に回すプロセスを採用しています。エージェントが設計案のスケッチと負荷テストを行い、タスク仕様書や評価基準を作成、フィクスチャレコードを整備します。さらに機械的なリンターを用いて、すべての要素が整合していることを保証します。審査(Admission)では、10〜12 の作成ルートを統合して目標ボリュームへの到達可能性を検証し、タスク固有の評価者機能を監査します。必要に応じて人間の承認も加えます。キュレーション(Curation)では、承認されたタスクにラベル付けを行い、トピック、規模、トポロジー、難易度のバランスが取れた最終セットを選定します。
詳細はこちら*タスク構築パイプラインは 4 つの段階で構成されます。シードで現実的なリクエストを特定し、作成者・批評家のループと機械チェックを通じて独立したタスクへと変換します。審査で実現可能性と評価者の質を検証し、キュレーションでバランスの取れた公開セットを選定します。最終的に 500 の公開タスクリソースパッケージが出力されます。*
中央値のタスクでは、50 人のメンバーが必要で、各メンバーあたり 4 件の記録、合計 245 件の記録が求められます。これら 500 のタスク全体では、170,495 件のソース裏付け付き記録が必要です。難易度は過去の設計段階でのロールアウト結果から調整し、ランク別に 167 件の低難易度、166 件の中難易度、167 件の高難易度の例に分割しました。
以下のプロットが示す通り、難易度は規模だけで決まるわけではありません。各記録にかかる作業量にも依存します。
広さ・深さ平面全体でのタスク難易度(対数対数プロット;ベンチマーク 500 タスク)。「広さ」は必要なメンバー数、「深さ」はそのメンバー数で割った記録数を指します。点の色は全体の難易度ラベルを表しています。破線のガイド線は、中央値の広さ(50 人)と中央値の深さ(メンバーあたり 4.00 件)を示しています。
参照なし・証拠検証型評価
オープンエンドな研究に対して固定された正解キーを用意するのは不適切です。作成コストが高く、すぐに陳腐化し、時とともに答えが変化する問いには対応できません。WANDR では代わりに、エージェントが引用した証拠に基づいて提出された各主張を採点します。
各記録には、項目、URL、抜粋、そして回答が含まれています。採点者はページを再取得し、以下の点を検証します。ページが利用可能か、主張が明確で範囲内か、抜粋がページ上に忠実に記載されているか、そしてページと抜粋の両方がすべての要件を満たしているかどうかです。
これらの二値判定結果は階層構造を通じて集約されます。Precision(精度)は、システムが提出した内容の質を測定します。一方、Recall(再現率)は、要求されたボリュームに対する品質調整済みの完了度を測り、不足分はゼロとしてカウントします。F1 スコアはこの二つをバランスよく統合した指標です。
ソフトスコアでは不完全なメンバーにも部分的に加点されますが、ハードスコアでは必須のサブツリー全体が正しく構成されたメンバーのみが対象となります。診断においては、WANDR はさらに「検索のみ」の判定も報告します。これは、厳格な妥当性チェックや提出された抜粋の確認を行う前に、取得したページ自体がタスクを遂行できるかを問うものです。
これにより、失敗の原因を解釈可能にし、局在化することが可能になります。精度が高く再現率が低い場合は、「良いメンバーを見つけられたが、数が不足している」ことを意味します。ソフトスコアからハードスコアへの大幅な低下は、「部分的な進展は見られたものの、完全な加点を得るために必要なすべての枝を完了させることが稀だった」という状況を示唆します。スコアツリーを用いれば、損失が発生した箇所を、発見(discovery)、情報補完(enrichment)、ID 処理、ページ選別、あるいは証拠抽出のいずれに特定することもできます。
採点パイプライン。Solve は各システムの出力を正規化し、fetch は引用されたページを取得してブラウザ上でリンク切れを再試行します。judge は ID を解決し、すべての記録を評価。score はこれらの判定を集約して、タスクレベルの精度、再現率、F1 スコアを算出します。
発見された事実
私たちは、6 つの生産システムを比較しました。これらには、ホスト型のタスク・検索 API、汎用 Web エージェント API、深層研究製品、そして私たちが開発したプログラムによる検索オーケストレーションシステム「Search as Code (SaC)」が含まれます。各システムは、500 の全タスクに対して固定された設定でスケジュールされ、同じ取得・判定・ID 解決・スコアリングの処理パイプラインを経験しました。
Perplexity の Search as Code が、ソフト F1 スコアで 0.363、ハード F1 スコアで 0.133 を記録し首位に立ちました。2 位は Anthropic で、それぞれ 0.249 と 0.072 です。他のすべてのシステムは、ソフト F1 が最大 0.121、ハード F1 が最大 0.035 に留まりました。どのシステムも、品質と効率の両方で圧倒的な優位性を示すものではありませんでした。
Perplexity はコスト面で中央に位置し、タスクあたり $5.20 です。解決までの中間値は 14.9 分、報告されたトークン数はタスクあたり 382 万です。OpenAI と Exa はより高速で安価ですが、スコアは大幅に低くなります。Anthropic は品質面で最も近い結果を出しましたが、その代償として時間、費用、トークン使用量を大幅に消費しました。
ソフト・ハード精度・再現率(上段)、およびソフト・ハード F1 スコア(下段)を、コスト、中央値解決時間、報告されたトークン使用量に対してプロットしたグラフ。左側で高いほど優れています。Exa と Parallel はトークン数の公開がないため、トークン関連のビューからは除外されています。
同じ 45 タスクのサブセットにおいて、利用可能なすべての努力設定(effort setting)を評価しました。努力度を上げると、Perplexity、Gemini、Exa のいずれも各段階で性能が向上します。特に Perplexity は最高設定(xhigh)でソフト F1 が 0.447、ハード F1 が 0.224 に達しました。
ただし、努力度を上げれば必ずしも良い結果になるとは限りません。OpenAI は「high」設定でピークに達し、Parallel は「ultra2x」から「ultra4x」へ移行する際にハード F1 がわずかに低下しています。
コストの範囲は 4 オーダー以上にも及び、Exa の低設定ではタスクあたり 0.03 ドルですが、Gemini の最大設定では 324.83 ドルに達します。
一致した 45 タスクのサブセット全体における、利用可能なすべての努力設定でのソフト F1(上段)とハード F1(下段)。濃い色のパスほど高い努力度を表します。
以下の 4 つの知見が際立っています。
部分的な進捗はよく見られますが、完全網羅は稀です。 どのシステムでもソフトリコール値はソフト精度値を下回っており、これは要求された全ボリュームが分母に含まれると性能が低下することを意味します。Perplexity は精度 0.389 からリコール 0.357 を維持し、最も差が小さい結果となりましたが、Anthropic は 0.354 から 0.222 へと大きく落ち込みました。さらに厳しくなるのはソフトからハードへの換算です。Perplexity の F1 スコアはソフトで 0.363 からハードでは 0.133 に急落し、Anthropic は 0.249 から 0.072 まで下がりました。ハード精度の最高値は 0.150、ハードリコールの最高値は 0.134 です。つまり、トップランカーであっても、提出したメンバーのうち約 7 人に 1 人、タスクが要求するメンバーのうちも約 7 人に 1 人しか完全な評価を得ていないことになります。
規模が大きくなるほど問題は深刻化します。 対象ボリュームの最小から最大までの範囲で比較すると、Perplexity のハード精度は 0.235 から 0.096 に、ハードリコールは 0.219 から 0.079 に低下しました。Anthropic は精度が 0.205 から 0.113、リコールが 0.127 から 0.042 へ。OpenAI も精度が 0.109 から 0.034、リコールが 0.102 から 0.016 と大幅な低下を示しました。一般的にリコールは精度よりも速く低下する傾向があり、システムによっては完全なメンバーを少数残しつつ、要求されたセット全体のカバレッジは次第に狭まっていくという現象が見られます。
階層が深くなるほど、評価はさらに厳しくなります。中間キーを 0 から 3 つ以上に増やすと、Perplexity のハード精度は 0.392 から 0.019 に、ハード再現率は 0.378 から 0.017 に急落します。Anthropic はそれぞれ 0.311→0.049、0.229→0.022 と低下し、OpenAI も 0.136→0.012、0.120→0.011 と大幅に悪化します。枝分かれが増えるごとに、すべての条件を満たす「オール・オア・ナッシング」のハードスコアを逃すリスクポイントが一つ増えるのです。
コストとレイテンシには、共通する単調な傾向は見られません。
ターゲットレコード数(上部)と中間階層の深さ(下部)における、高精度・高再現率、中央値解決レイテンシ、および平均コスト。
各ラインは1 つの固定されたメイン実行設定を表しています。可読性のためにタスクビン集計を結ぶラインは、スケールや構造による因果関係を意味するものではありません。
品質を評価する以前に、発見(ディスカバリー)こそが最初の構造的ボトルネックです。
単純な生データ(事前圧縮後のカウント)だけを見ても、最上位レベルの発見完了率は 0.611 から 0.951 の範囲にあります。条件付きの補強(エンリッチメント)は 0.767〜0.967 とより高く、メンバーとその補強パスが確立された後の最終的な証拠スロットの完了率は 0.979〜0.994 に達します。
発見と補強においては Perplexity がそれぞれ 0.951 と 0.967 でリードしていますが、OpenAI は最終的な証拠スロットにおいてわずかに上回る 0.994 を記録し、Perplexity の 0.991 を上回っています。
重複の圧縮によるカウント減少は、6 つの完全実行全体で 0.017〜0.205 パーセントポイントに過ぎず、不足が主因であり、同一性の統合(マージ)が主な原因ではありません。最大の構造的損失は、最終的な URL が付与される前の段階で発生しています。
検証ツリーから得たタスクレベルの生構造的完成度の概要。Discovery が最上位キー、enrichment が中間キー、evidence が終端キーとなります。数値は事前結合されたカウントを使用しているため、この図は記録品質が評価される前に提出されたボリュームのどこに不足があるかを孤立して示しています。
使い可能なページを見つけるのは通常容易ですが、完全な証拠を揃えるのは困難です。 5 つのシステムにおいて、提出されたページの unusable(使用不可)割合は 3.2%〜8.9% に過ぎません。ただし OpenAI は 23.1% という外れ値です。無効またはタイプが異なるレコードも比較的多くはありません(4.2%〜17.4%)。しかし、主要な損失はこれらに次いで発生します。提出されたページの 33.6%〜68.3% が少なくとも一つの重要なタスク要件を満たせず、提出された抜粋の 57.5%〜86.6% がレコードが主張するすべての内容を裏付けることができていません。
Perplexity の場合、これらの割合はそれぞれ 41.4% と 57.5% です。そのソフト F1 スコアは、ページがすべての重要な要件を満たしているかどうかだけを問う検索のみによるチェックでは 0.531 ですが、普遍的なチェックやタスク固有の有効性、そして抜粋の完全な裏付けも要求される包括的な判定下では 0.363 に低下します。ハード F1 も同様に 0.245 から 0.133 へと下がります。
重要なのは、単に妥当なページに到達することではなく、そのページを主張全体に対する十分な証拠へと変換できるかどうかにあります。
検証結果から得たレコードレベルの失敗事例をパーセントで計測(数値が低いほど良好)。ページ要件や抜粋要件に関する失敗は、利用不能なページや無効なレコードに関する失敗に比べて圧倒的に多い。並列処理では 350 タスク分の診断詳細を取得できる一方、他の行は 490〜500 タスク分をカバーしています。
「検索をコードとして扱う」というアプローチは、このタスク形状と非常に相性が良いです。モデル側で検索、フィルタリング、並列展開(fan-out)、レンダリング、結合、重複削除、停止ロジックなどをプログラムとして記述できるため、モデルのコンテキスト外で行われる反復処理を決定論的な計算リソースが担当できます。このプロファイルは、Perplexity の広範な文脈保持能力や抜粋構築の強みと一致していますが、すべての層で首位を争っているわけではありません。ページ要件に関する失敗率が最も低いのは Anthropic です。
今後の展望
WANDR は単なるリーダーボードのスコアを提供するだけではありません。共通のタスク構造と半自動パイプラインにより、多様な高ボリュームなタスク生成が可能になります。また、レコードごとの判定結果や階層レベルのスコアによって、発見、情報補完、アイデンティティ処理、意味的資格付け、証拠構築のいずれの段階で失敗したかを特定できます。公開されたタスクセット、検証ツール、構造的診断機能は、包括的な検索システムの改善に向けた基盤となり、その向上がスケールしても持続するかを検証する手段を提供します。
同様の構造は、強化学習においても WANDR を有用なものにします。単一のスパースな最終報酬に依存するのではなく、トレーナーは記録レベルや分岐レベルでの判断を活用し、発見とエンリッチメントの進捗に対して部分的な評価を与えることで、必要なカウント数を時間とともに引き上げるようなカリキュラムを構築できます。
このパイプラインは、ゴールドアンサーを列挙することなく、ドメイン、階層形状、証拠ルール、幅深さの設定にわたって、保持された兄弟タスクを生成することが可能です。これにより、エージェントが正解を見つけるだけでなく、カバレッジの計画を立て、欠落した分岐を検出し、停止する前に回復する方法も学習できる道が開けます。
ベンチマークタスク、評価ハネス、そして完全な技術レポートは GitHub で利用可能です。
AI算出
主要ニュースainew評価高い
記事は AI エージェントの研究能力を評価する新たなベンチマーク WANDR の公開を核心としており、DRACO との違いや階層パターンの詳細など技術的な新情報を提供している。日本企業への直接的な影響や日本語一次情報はないが、AI リサーチ分野の重要な進展であるため高スコアとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み