MarkTechPostメディア報道·2026年7月19日 16:19·約9分
Perplexity AI が研究エージェント評価ベンチ「WANDR」公開
本文の状態
日本語全文あり
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
30秒でわかる
Perplexity AI は研究エージェントの能力を評価するオープンベンチマーク「WANDR」を発表し、単一の回答精度ではなく広範かつ深掘りした証拠に基づく情報収集能力を検証する新基準を設定した。
記事の3ポイント
WANDR の定義と目的
Perplexity AI が発表した WANDR は、エージェントが「広い範囲」で多数のエンティティを発見し、「深い調査」で各主張を証拠で裏付ける能力を同時に評価するためのオープンベンチマークである。
評価メカニズムの特徴
WANDR は「会社 (n) -> 従業員 (m) -> URL(k)」のような階層的な資格キー構造を採用し、単なる数値の正確性ではなく、大規模で証拠に裏付けられたコレクションの構築能力を問う。
タスク生成プロセス
本ベンチマークの 500 の課題は、合成プロンプトではなく実際の生産環境での非特定化されたパターンに基づき、シード、作成、承認、キュレーションの 4 つの段階を経て生成されている。
なぜ重要か・誰に関係するか
この発表が重要なのは、研究エージェントの評価基準を単なる回答の正誤から、証拠に基づく大規模情報の収集・構築能力へと根本的に転換させるからだ。開発者や企業の AI 導入担当者は、自社のエージェントが複雑な実務タスクで信頼できるかどうかを検証する際に、この WANDR ベンチマークの結果を重要な判断材料として確認すべきである。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
この記事をシェア
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み