Perplexity AI が研究エージェント評価ベンチ「WANDR」公開
Perplexity AI は、研究エージェントの広範かつ深層的な調査能力を評価するためのオープンベンチマーク「WANDR」を発表し、単一の回答精度だけでなく証拠に基づく大規模データ収集の難易度を定量化した。
キーポイント
WANDR ベンチマークの定義と目的
既存のベンチマークが単一回答の精度に焦点を当てる中、WANDR は「広い範囲(Wide)」での情報発見と「深い調査(Deep)」での証拠裏付けの両方を同時にテストする新しい評価基準として設計された。
階層的なタスク構造による厳格な検証
企業、従業員、URL などの要素を階層化し、各パスが独立して検証される「コンポーザブル資格キーヒエラルキー」を採用することで、不完全なナラティブや限定的な事例では高得点が取得できない構造となっている。
実世界データに基づく大規模タスク生成
合成されたプロンプトではなく、実際の生産環境での非識別化パターンを基に、シードからキュレーションまでの自動化パイプラインで 500 の現実的な課題が生成されており、中位値でも 50 件のメンバーと 245 件の記録を要求する。
厳格な評価基準と難易度
WANDR は固定された正解キーではなく、各主張が引用された証拠によって裏付けられているかを再検証するバイナリ評価を行い、難易度は規模ではなく記録ごとの作業量に基づいて分類されます。
現状のシステム性能とボトルネック
どのシステムも完全な解決には至っておらず、特に深い階層構造では失敗ポイントが積み重なるため、部分的な進捗はあっても完全な網羅性は達成されていません。
Search as Code の有効性
検索、フィルタリング、並列処理などのロジックをプログラムとして記述できる「Search as Code」アプローチが、この複雑なタスク形状に特に適しており、モデルのコンテキスト外で決定論的な計算を行うことで効果を発揮します。
実務的なタスクのシミュレーション
WANDR は市場分析、デューデリジェンス、人材採用など、チームが既に自動化している「広範かつ深掘り」な収集パターンを専門スケールでテストします。
重要な引用
WANDR instead asks whether it can build a large collection with evidence.
A few compelling examples are not enough here. A polished narrative built on incomplete research also falls short.
One task might request company(n) -> employee(m) -> url(k). This means n qualifying companies, m employees each, and k supporting pages each.
Every system shows soft recall below soft precision.
Turning it into complete evidence is the hard part.
WANDR tests exactly these wide-and-deep collection patterns at professional scale.
影響分析・編集コメントを表示
影響分析
この発表は、AI エージェントの評価基準が「正確な回答」から「信頼性の高い大規模調査プロセス」へとパラダイムシフトする重要な転換点を示しています。特に金融や法務のような証拠に基づく意思決定が必要な領域において、エージェントの信頼性を定量的に評価するための標準的な指標として WANDR が機能し、業界全体のベンチマーク水準を引き上げる可能性があります。
編集コメント
研究エージェントの能力評価において、単一の正解だけでなく「証拠に基づく大規模データ収集」のプロセスを重視する WANDR の登場は、実務レベルでの信頼性検証に不可欠なステップです。特に DRACO との対比により、Perplexity が調査の深さと広さの両軸でエージェントを厳しく評価しようとする姿勢が明確になりました。
研究エージェントはすでに今日、実際の知識労働を担っています。チームは競合分析やデューデリジェンス、文献レビューといった業務をこれらに委ねています。しかし、既存のベンチマークの多くは単一の回答を検証するものであり、大規模な証拠に基づくコレクションの評価には対応していませんでした。
Perplexity はこのギャップを埋めるため、新しいオープンベンチ「WANDR(Wide ANd Deep Research)」を発表しました。これは知識労働における 500 の現実的で難易度の高いデータ収集タスクを中心に構築された、オープンなベンチマークおよび評価ハーンです。
WANDR は、Perplexity が以前に発表した深層研究向けベンチ「DRACO」の広域版にあたる存在です。DRACO がエージェントが正確で完全かつ客観的な長文レポートを生成できるかを問うものであれば、WANDR は大規模なコレクションを証拠とともに構築できるかを問います。
WANDR とは何か
WANDR の核心には、2 つの要件を同時にテストするという特徴があります。「Wide(広さ)」とは、大規模でしばしば開かれた範囲の合格対象エンティティを発見することを指し、「Deep(深さ)」とは、各主張を証拠で裏付けるためにそれぞれのエンティティを十分に調査することを意味します。この 2 つを組み合わせることで、エージェントが直面する課題の本質が変わります。
単に数個の魅力的な例を示すだけでは不十分です。また、不完全な研究に基づいて磨き上げられた物語も、要件を満たすには足らないのです。
これを捉えるため、WANDR は構成可能な資格キー階層を採用しています。あるタスクでは「company(n) -> employee(m) -> url(k)」といった形式で要求が出されます。これは「n 社の合格企業」「各社から m 人の従業員」「各従業員について k ページの支持ページ」という意味です。
ツリー内のすべての完全なパスは独立して検証されます。この構造は、フラットリスト、ネストされた検索、あるいはマトリックス形式など、多様な形態を表現できます。
具体的なタスク例
必ず JSON 形式で返してください。translation フィールドのみ。他のフィールドは一切追加しないこと — 余計なフィールドを書こうとして本文がトークン上限で打ち切られる事故を防ぐため:
{"translation": "リライト全文"}
この階層構造を具体化するために、公開された「CEO・CFOの人事異動」タスクを検討してみましょう。このタスクでは、少なくとも 70 の米国企業を対象とし、各社で 2026 年 3 月 1 日から 4 月 30 日の間に初めて発表された CEO または CFO の人事異動情報を取得する必要があります。エージェントは、各事例について信頼性の高い公式ページを 1 つ提示します。さらにサブタスクとして、各企業ごとに「リスト掲載権限」を持つページも 1 つ用意することが求められます。これらを合わせると、合計 140 のソース裏付け済みレコードが生成されることになります。
具体的には、2 つの階層構造と提出された 1 つのレコードは以下のようになります。
現実的なタスクを大規模に生成する仕組み
単なるサンプル例にとどまらず、WANDR のタスクは実際の利用シーンに基づいて構築されています。合成されたプロンプトではなく、生産環境で観測された匿名化されたパターンから出発し、半自動パイプラインがこれらを具体的なタスクへと変換します。このパイプラインには「シード(種まき)」「作成」「審査」「キュレーション」の 4 つの工程が含まれます。また、機械的なリントチェックを挟みながら、作成者と批評家が交互に作業を行うループ構造を採用しています。
その結果、タスクの中央値はメンバー数 50 件、記録総数 245 件となりました。全体で 500 のタスクを処理する際、WANDR は 170,495 件の出典裏付け付き記録を要求します。難易度は「低」「中」「高」の 3 つに分類され、それぞれ 167、166、167 タスクずつ割り当てられています。重要なのは、難易度が単なる規模ではなく、個別の記録にかかる作業量によって決まる点です。
WANDR の評価方法
WANDR は固定された正解キーを用いるのではなく、各主張が引用された証拠に基づいて採点されます。各記録には、対象アイテム、URL、選択した抜粋、そして回答が含まれています。評価時にはグレーダー(採点者)が再度ページをフェッチし、そのページが利用可能で範囲内にあるかを確認します。その後、抜粋が実際に存在し、すべての要件を裏付けているかを検証します。
これらの二値判定(Yes/No)は階層構造を通じて集約されます。「精度」はシステムが提出した内容の質を測る指標であり、「再現率」は品質調整済みで完了した割合を示します。不足分はゼロとして扱われます。「ソフトスコア」では不完全なメンバーにも部分的に加点されますが、「ハードスコア」は、完全なサブツリーが正解である場合のみカウントされる厳格な評価です。
ベンチマークの結果
この手法に基づき、Perplexity は 500 の全タスクに対して 6 つの生産システムをテストしました。その結果、自社開発の「Search as Code (SaC)」が首位に立ちました。しかし、どのシステムもベンチマークを完全に解決するには至っていません。
| システム | ソフト F1 | ハード F1 | 備考 |
|---|---|---|---|
| Perplexity (Search as Code) | 0.363 | 0.133 | 1 タスクあたり 5.20 ドル、中央値 14.9 分、1 タスクあたり 382 万トークン |
| Anthropic | 0.249 | 0.072 | 品質面では最も近いが、時間・費用・トークン消費量が多い |
| Others (best) | 0.121 | 0.035 | OpenAI や Exa は高速で安価だが、スコアは低め |
さらに努力を積み重ねれば、Perplexity は xhigh の設定においてソフト F1 スコア 0.447 を達成します。一方、コストは設定によって桁違いにばらつき、最小でタスクあたり 0.03 ドルから最大で 324.83 ドルまで広がっています。
リーダーボードの結果以外にも、4 つの重要な発見があります。第一に、部分的な進捗は見られるものの、完全な網羅性は達成できていません。すべてのシステムにおいて、ソフトリコールはソフトプレシジョンを下回っています。第二に、規模が拡大するほど問題は深刻化します。特に階層構造が深くなるほど悪影響が大きく、各分岐が新たな失敗の要因となるためです。第三に、情報の発見プロセスが最初の構造的ボトルネックとなっています。システム間でトップレベルでの発見完了率は 0.611 から 0.951 の範囲で大きく開いています。不足しているボリュームの主な原因は重複マージではなく、検出漏れによる未達です。第四に、有用なページを見つけること自体は通常容易ですが、それを完全な証拠として確立するのが難しいのです。Perplexity の場合、ページの 41.4% が実質的な要件を満たしておらず、また抜粋の 57.5% が主張全体を裏付けるのに失敗しています。その結果、検索機能のみを検証した場合のソフト F1 は 0.531 ですが、完全な判定基準を適用すると 0.363 に低下します。
特筆すべきは、「Search as Code」がこのタスクの形状に非常に適している点です。エージェントは、検索、フィルタリング、分岐処理(fan-out)、結合、重複排除、停止ロジックなどをプログラムとして記述できます。これにより、モデルのコンテキスト外で反復的な計算を確定的なコンピューティングが処理できるようになります。
ユースケースと具体例
実務の観点から、WANDR はすでにチームが自動化している業務に直結しています。例えば市場アナリストは、対象となる競合他社をすべて特定し、それぞれの根拠となる証拠も揃える必要があります。デューデリジェンスチームは数十社の企業情報を収集した上で、所有権構造や経営陣、資金調達状況まで把握する必要があります。人材採用担当者は多数の候補者を洗い出し、それぞれに裏付けとなるプロフィールページを用意しなければなりません。WANDR はまさにこうした「広範かつ深掘り」なデータ収集パターンを、プロフェッショナルなスケールでテストするものです。
評価がレコード単位で行われるため、チームは失敗した箇所を正確に特定できます。スコアツリーによって、問題が「発見段階」「情報補完段階」、あるいは「証拠抽出段階」のいずれにあるのかを切り分けることができます。この診断結果はエンジニアにとって貴重で、弱点となる工程を一つずつ改善していく指針となります。
Key Takeaways
- WANDR は、500 件の証拠重視の広範かつ深掘りタスクからなるオープンベンチマークです。
- タスクでは、パスごとに検証された資格キー階層が使用されます。
- 評価は参照データなしで行われ、評価者が引用された証拠を再取得して確認します。
- Perplexity Search as Code がソフト F1 で 0.363、ハード F1 で 0.133 を記録し首位に立ちました。
- 「発見」と「完全な証拠の収集」が最大の課題となっています。
技術詳細とリポジトリはこちらをご覧ください。Twitter でもフォローいただけますし、ML サブレッド(登録者数 15 万人超)への参加やニュースレターの購読もぜひご検討ください。Telegram をご利用の方も、今なら Telegram チャンネルに参加できます。
GitHub リポジトリや Hugging Face ページ、製品リリース、ウェビナーなどのプロモーションを当社と連携して行いたい場合は、お気軽にご連絡ください。
本記事は MarkTechPost にて公開された「Perplexity AI Releases WANDR: An Open Benchmark Evaluating Research Agents That Must Search Wide And Deep」の翻訳です。
原文を表示
Research agents already handle real knowledge work today. Teams delegate competitive mapping, due diligence, and literature review to them. However, most benchmarks test a single answer, not large evidence-backed collections. Perplexity targets that gap with a new open benchmark.
Perplexity released WANDR (Wide ANd Deep Research). It is an open benchmark and evaluation harness. It is built around 500 realistic, challenging data-collection tasks for knowledge work. WANDR is the wide sibling of Perplexity’s DRACO benchmark for deep research. DRACO asks whether an agent produces an accurate, complete, objective long-form report. WANDR instead asks whether it can build a large collection with evidence.
What is WANDR
At its core, WANDR tests two demands together. Wide means discovering a large, often open-ended set of qualifying entities. Deep means investigating every entity enough to support each claim with evidence. Combining both changes the problem for agents. A few compelling examples are not enough here. A polished narrative built on incomplete research also falls short.
To capture this, WANDR uses a composable qualification key hierarchy. One task might request company(n) -> employee(m) -> url(k). This means n qualifying companies, m employees each, and k supporting pages each. Every complete path through the tree gets validated independently. The same structure can represent a flat list, nested search, or matrix.
A Concrete Task Example
To ground that hierarchy, consider the released ceo_cfo_appointments task. It asks for at least 70 US-based companies. Each must have a CEO or CFO appointment first announced between March 1 and April 30, 2026. For each, the agent supplies one authoritative appointment page. A subtask adds a listing-authority page per company. Together, the task requires 140 source-backed records.
Concretely, the two hierarchies and one submitted record look like this:
Copy CodeCopiedUse a different Browser
Task hierarchies
company(70) -> company_appointee(1) -> url(1) # 70 appointment records
company(70) -> url(1) # 70 listing records
One record the grader re-fetches and re-checks (values are illustrative)
{
"item": "Example Corp - new CFO",
"url": "https://issuer.example.com/press/cfo-appointment",
"excerpts": ["Example Corp today named Jane Doe as Chief Financial Officer, effective April 2026."],
"answer": "Jane Doe appointed CFO; announced April 2026"
}
Realistic Tasks, Generated At Scale
Beyond single examples, WANDR builds its tasks from real usage. It starts from de-identified patterns seen in production, not synthetic prompts. A semi-automated pipeline then turns those patterns into tasks. The pipeline runs four stages: seeding, authoring, admission, and curation. It uses an interleaved author-critic loop with mechanical linting.
As a result, the median task asks for 50 members and 245 records overall. Across all 500 tasks, WANDR calls for 170,495 source-backed records. Tasks split into 167 lower, 166 middle, and 167 higher difficulty. Difficulty depends on per-record work, not scale alone.
How WANDR Grades Agents
Unlike fixed answer keys, WANDR grades each claim against cited evidence. Every record contains an item, URL, selected excerpts, and answer. The grader re-fetches the page during evaluation. It checks whether the page is usable and in scope. It then verifies the excerpts truly appear and support every requirement.
These binary record verdicts then roll up through the hierarchy. Precision measures the quality of what a system submitted. Recall measures quality-adjusted completion, filling any shortfall with zeros. Soft scores give partial credit to incomplete members. Hard scores count only members whose full subtree is correct.
The Benchmark Results
Using that method, Perplexity ran six production systems on all 500 tasks. Its own Search as Code (SaC) system leads. Still, no system comes close to solving the benchmark.
SystemSoft F1Hard F1Notes
Perplexity (Search as Code)0.3630.133$5.20/task, 14.9-min median, 3.82M tokens/task
Anthropic0.2490.072Closest on quality, but more time, money, tokens
Others (best)0.1210.035OpenAI, Exa faster and cheaper, but lower scores
With more effort, Perplexity reaches 0.447 soft F1 at the xhigh setting. Cost across settings spans more than four orders of magnitude. It ranges from $0.03 per task up to $324.83 per task.
Beyond the leaderboard, four findings stand out. First, partial progress is common, but complete coverage is not. Every system shows soft recall below soft precision. Second, scale compounds the problem sharply. Deeper hierarchies hurt most, since each branch adds a failure point. Third, discovery is the first structural bottleneck. Top-level discovery completion ranges from 0.611 to 0.951 across systems. Under-delivery, not duplicate merging, explains most missing volume. Fourth, finding a usable page is usually easy. Turning it into complete evidence is the hard part. For Perplexity, 41.4% of pages miss a substantive requirement. Also, 57.5% of excerpts fail to support the full claim. Its soft F1 falls from 0.531 under a retrieval-only check to 0.363 under the full verdict.
Notably, Search as Code fits this task shape well. An agent can express retrieval, filtering, fan-out, joins, deduplication, and stopping logic as a program. Deterministic compute then handles repeated operations outside the model context.
(function(){
window.addEventListener('message',function(e){
if(e && e.data && e.data.mtpWandrHeight){
var f=document.getElementById('mtp-wandr-frame');
if(f) f.style.height=e.data.mtpWandrHeight+'px';
}
});
})();
Use Cases With Examples
Practically, WANDR maps to jobs teams already automate. A market analyst needs every qualifying competitor, with matching evidence for each. A due-diligence team needs dozens of companies, then ownership, executives, and financing. Talent sourcing needs many candidates, each with supporting profile pages. WANDR tests exactly these wide-and-deep collection patterns at professional scale.
Because grading is per-record, teams can localize failures precisely. The score tree isolates loss to discovery, enrichment, or evidence extraction. This diagnosis helps engineers improve one weak stage at a time.
Key Takeaways
WANDR is an open benchmark with 500 evidence-heavy, wide-and-deep tasks.
Tasks use a qualification key hierarchy validated path by path.
Grading is reference-free; the grader re-fetches and checks cited evidence.
Perplexity Search as Code leads at 0.363 soft F1 and 0.133 hard F1.
Discovery and complete evidence remain the biggest failure points.
Check out the Technical details and Repo here. Also, feel free to follow us on Twitter and don’t forget to join our 150k+ML SubReddit and Subscribe to our Newsletter. Wait! are you on telegram? now you can join us on telegram as well.
Need to partner with us for promoting your GitHub Repo OR Hugging Face Page OR Product Release OR Webinar etc.? Connect with us
The post Perplexity AI Releases WANDR: An Open Benchmark Evaluating Research Agents That Must Search Wide And Deep appeared first on MarkTechPost.
関連記事
今日のまとめ
AI日報で今日の重要ニュースをまとめ読み