PACE:エージェント型能力評価のためのプロキシ手法(2 分読了)
本文の状態
日本語全文を表示中
詳細モードで約8分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
TLDR AI が紹介した PACE フレームワークは、非エージェント型ベンチマークの選抜データを用いた回帰モデルにより、高コストなエージェント型 LLM ベンチの評価結果を高精度で予測する。これにより評価コストを 99% 以上削減し、モデル開発と選択を支援している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
これはライブラリアンボットからの自動メッセージです。この論文と類似する以下の論文を見つけました。
Semantic Scholar API によって推奨された以下の論文:
- WildClawBench: 現実世界における長期ホライゾンのエージェント評価のためのベンチマーク (2026)
- SWE-Explore: コーディングエージェントがリポジトリをどのように探索するかをベンチマークする (2026)
- RealClawBench: 実際の開発者 - エージェントセッションからのライブオープンクローブenchmarks (2026)
- LLM エージェントにおける手続き記憶の管理:制御、適応、および評価 (2026)
- より多くのエージェントが役立つか?LLM エージェントワークフローの統制されたプロトコル整合型評価 (2026)
- 初期経験からのエージェントルーティング学習 (2026)
- FastContext: コーディングエージェント向けの効率的なリポジトリエクスプローラーのトレーニング (2026)
このコメントが役に立った場合は、このコメントに「いいね」をお願いします!
Hugging Face 上の任意の論文に関する推奨事項をご希望の場合は、こちらの Space をご覧ください。
コメントで @librarian-bot recommend とタグ付けすることで、ライブラリアンボットに直接論文の推薦を依頼できます。
"updatedAt":"2026-07-04T04:37:25.022Z","author":{"_id":"63d3e0e8ff1384ce6c5dd17d","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/1674830754237-63d3e0e8ff1384ce6c5dd17d.jpeg","fullname":"Librarian Bot (Bot)","name":"librarian-bot","type":"user","isPro":false,"isHf":false,"isHfAdmin":false,"isMod":false,"followerCount":372,"isUserFollowing":false}},"numEdits":0,"identifiedLanguage":{"language":"en","probability":0.7221300601959229},"editors":["librarian-bot"],"editorAvatarUrls":["https://cdn-avatars.huggingface.co/v1/production/uploads/1674830754237-63d3e0e8ff1384ce6c5dd17d.jpeg"],"reactions":[],"isReport":false}}],["primaryEmailConfirmed":false,"paper":{"id":"2607.02032","authors":[{"_id":"6a47204e6ee372f6920de2fa","name":"Yueqi Song","hidden":false},{"_id":"6a47204e6ee372f6920de2fb","name":"Lintang Sutawika","hidden":false},{"_id":"6a47204e6ee372f6920de2fc","name":"Jiarui Liu","hidden":false},{"_id":"6a47204e6ee372f6920de2fd","name":"Lindia Tjuatja","hidden":false},{"_id":"6a47204e6ee372f6920de2fe","name":"Jiayi Geng","hidden":false},{"_id":"6a47204e6ee372f6920de2ff","name":"Yunze Xiao","hidden":false},{"_id":"6a47204e6ee372f6920de300","name":"Daniel Lee","hidden":false},{"_id":"6a47204e6ee372f6920de301","name":"Aditya Bharat Soni","hidden":false},{"_id":"6a47204e6ee372f6920de302","name":"Vincent Lo","hidden":false},{"_id":"6a47204e6ee372f6920de303","name":"Xiang Yue","hidden":false},{"_id":"6a47204e6ee372f6920de304","name":"Graham Neubig","hidden":false}],"publishedAt":"2026-07-02T00:00:00.000Z","submittedOnDailyAt":"2026-07-03T00:00:00.000Z","title":"PACE: A Proxy for Agentic Capability Evaluation","submittedOnDailyBy":{"_id":"6039478ab3ecf716b1a5fd4d","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/6039478ab3ecf716b1a5fd4d/_Thy4E7taiSYBLKxEKJbT.jpeg","isPro":true,"fullname":"taesiri","user":"taesiri","type":"user","name":"taesiri"},"summary":"SWE-Bench や GAIA などのベンチマークで LLM エージェント(LLM agents)を評価することは、コストが高く、時間がかかり、複雑なインフラストラクチャが必要です。単一の評価には数千ドルの費用がかかることもあり、完了までに数日かかることもあります。一方、推論やコード生成など個々の能力(atomic capabilities)のみをテストする非エージェント型 LLM ベンチマークは、実行が迅速で安価です。本論文では、高コストなエージェントベンチマークでのパフォーマンスを、小さく慎重に選択された原子評価インスタンスのサブセット上でのパフォーマンスによって正確に予測できるかどうかを検証します。私たちは PACE というフレームワークを導入しました。これは、エージェントベンチマークにおけるモデルのパフォーマンスを最も信頼性高く予測する集計スコアを持つ既存の非エージェント型評価からインスタンスを選択することで、プロキシベンチマーク(proxy benchmarks)を構築するものです。原子的能力にわたる候補インスタンスのプールが与えられた場合、PACE は、コンパクトなソースインスタンスのサブセット上でのモデルのスコアを、ターゲットのエージェントベンチマーク上のスコアにマッピングする回帰分析(regression)をフィットさせます。このサブセット自体は、ターゲット関連性に基づく局所選択(target-relevance local selection)と、グローバルに情報豊富なグローバル選択(globally informative global selection)という 2 つの相補的なインスタンス選択戦略を組み合わせてキュレーションされます。PACE を本論文で扱う 4 つのエージェントベンチマークに適用することで、PACE-Bench という具体的なプロキシベンチマークが得られ、これが本論文で評価される対象となります。14 のモデル、4 つのエージェントベンチマーク、および 19 の非エージェント型ベンチマークにわたる実験により、PACE-Bench は、アウトオブサン(leave-one-out)クロスバリデーション(LOOCV)における平均絶対誤差(MAE)が 4% 未満、スピアマン相関(Spearman correlation)が 0.80 を超え、ペアワイズモデルランキング精度(pairwise model-ranking accuracy)が約 85% に達することが示されました。これらはすべて、完全なエージェント評価コストの 1% も満たないコストで達成されています。さらに、選択されたプロキシインスタンスを分析し、各エージェントベンチマークが独自に要求するスキルが明らかになりました。PACE を用いることで、実践者は、フルエージェント評価のオーバーヘッドなしに、モデルの開発、選定、ルーティング中にエージェントパフォーマンスの信頼できる推定値を得ることができます。","upvotes":14,"discussionId":"6a47204f6ee372f6920de305","ai_summary":"PACE は、高コストなエージェント型 LLM ベンチマークのパフォーマンスを、原子評価インスタンスの小さなサブセットを用いて予測するフレームワークであり、コストの大幅な削減ながら高い精度を実現します。","ai_keywords":["LLM agents","SWE-Bench","GAIA","agentic benchmarks","non-agentic benchmarks","proxy benchmarks","regression","instance-selection strategies","target-relevance local selection","globally informative global selection","leave-one-out cross-validation","mean absolute error","Spearman correlation","pairwise model-ranking accuracy"],"ai_summary_model":"Qwen/Qwen2.5-Coder-32B-Instruct"},"canReadDatabase":false,"canManagePapers":false,"canSubmit":false,"hasHfLevelAccess":false,"upvoted":false,"upvoters":[{"_id":"6a2da6c8ca070ee12c6e396c","avatarUrl":"/avatars/0355287dcabaa67dbc7f0b10b87451f9.svg","isPro":false,"fullname":"Joe Mama","user":"JoeMama123123123","type":"user"},{"_id":"69a40193e47f4320d87378a0","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/noauth/SacorIUGoZu4Z3MUArRrj.png","isPro":false,"fullname":"Chenxi Gao","user":"zruilin7wi","type":"user"},{"_id":"697c8b15a7f796854ef333c4","avatarUrl":"/avatars/94de3a736fac914944f1b57609e3819a.svg","isPro":false,"fullname":"Joel Wang","user":"joelhenwang","type":"user"},{"_id":"650bfb96d564b800cc7fde73","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/noauth/DoFM731uaoaNDue1Nm_Zp.png","isPro":false,"fullname":"Maojia Song","user":"OrangeEye","type":"user"},{"_id":"63e7bf7be02ee67e8e53f78d","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/63e7bf7be02ee67e8e53f78d/z9j1PWrurEyIA2JXzpz0i.png","isPro":false,"fullname":"Yueqi Song","user":"yueqis","type":"user"},{"_id":"6358edff3b3638bdac83f7ac","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/1666772404424-noauth.jpeg","isPro":false,"fullname":"Pratyay Banerjee","user":"Neilblaze","type":"user"},{"_id":"63ac5701c21e60a3e9b58aa7","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/63ac5701c21e60a3e9b58aa7/g6EX7diOpuA94R2ab-rZC.png","isPro":true,"fullname":"Dipankar Sarkar","user":"dipankarsarkar","type":"user"},{"_id":"69bb584cfe142225ca7e484c","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/noauth/gLJfInRNmFDQTaqmHSZyo.png","isPro":false,"fullname":"Xiao Yutian","user":"riley-scott55","type":"user"},{"_id":"69bcb365518f6d1f3d29b6a6","avatarUrl":"https://cdn-avatars.huggingface.co/v1/production/uploads/noauth/3McEtiC4SdYb8VfFgnw6e.png","isPro":false,"fullname":"Семёнов Максим","user":"yuziyu63","type":"user"},{"_id":"62ea79dd01ed9b0e8f61ccd3","avatarUrl":"/avatars/70af83e0e267be39fcd5f23b85e2dafa.svg","isPro":false,"fullname":"Chengsong Huang","user":"ChengsongHuang","type":"user"},{"_id":"64706ed2fa9fd77212de57ed","avatarUrl":"/avatars/e27564d1ba5bd77212de57ed","isPro":false,"fullname":"Jiarui Liu","user":"Jerry999","type":"user"},{"_id":"650f4ae42a45730c3fedf001","avatarUrl":"/avatars/fc9274aeb0dc2071b12acfe52023bbe.svg","isPro":false,"fullname":"Jiayi Geng","user":"JiayiG","type":"user"}],"acceptLanguages":["*"],"dailyPaperRank":0,"markdownContentUrl":"https://huggingface.co/buckets/huggingchat/papers-content/resolve/2607/2607.02032.md","query":{"utm_source":"tldrai"}}"> 2026 年 7 月 2 日公開
著者:
,
,
,
,
,
,
,
,
,
Abstract
PACE は、高コストなエージェント型大規模言語モデル(LLM)のベンチマーク性能を、少数の原子評価インスタンスを用いて予測するフレームワークであり、そのコストはごく一部で済むながら高い精度を実現します。
SWE-Bench や GAIA といったベンチマークにおいて LLM エージェント を評価することは、費用がかさみ、時間がかかり、複雑なインフラを必要とします。単一の評価には数千ドルの費用がかかることもあり、完了までに数日かかることもあります。一方、推論やコード生成といった個々の能力のみを検証する非エージェント型 LLM ベンチマークは、迅速かつ低コストで実行可能です。本論文では、高価な エージェント型ベンチマーク におけるパフォーマンスを、細かく選定された原子評価インスタンスの小さなサブセットでのパフォーマンスによって正確に予測できるかどうかを検証します。私たちは PACE というフレームワークを導入しました。これは、既存の非エージェント型評価から、その集計スコアが エージェント型ベンチマーク におけるモデルのパフォーマンスを最も信頼性高く予測できるインスタンスを選択することで、プロキシ・ベンチマーク を構築するものです。原子的能力にわたる候補インスタンスのプールから、PACE は、コンパクトなソース・インスタンスのサブセットにおけるモデルのスコアを、ターゲットとなるエージェント型ベンチマークでのスコアへとマッピングする 回帰 をフィットさせます。このサブセット自体は、2 つの相補的な インスタンス選択戦略、すなわち「ターゲット関連性に基づく局所選択 (target-relevance local selection)」と「グローバルに情報豊富なグローバル選択 (globally informative global selection)」を組み合わせることで選別されます。PACE を本論文で扱う 4 つのターゲット エージェント型ベンチマーク に適用することで、本論文で評価する具体的なプロキシ・ベンチマークである PACE-Bench が得られます。14 のモデル、4 つの エージェント型ベンチマーク、および 19 の 非エージェント型ベンチマーク にわたる実験により、PACE-Bench は、leave-one-out クロスバリデーション (LOOCV) において 平均絶対誤差 (MAE) が 4% 未満、スピアマン相関係数 が 0.80 を超え、ペアモデルランキング精度 が約 85% であることを示しました。これらはすべて、完全なエージェント評価コストの 1% も満たないコストで達成されています。さらに、選択されたプロキシ・インスタンスを分析することで、各エージェント型ベンチマークが独自に要求するスキルが明らかになりました。PACE を用いることで、実践者は、フルエージェント評価に伴うオーバーヘッドなしに、モデルの開発、選定、ルーティングの過程において、エージェントのパフォーマンスに関する信頼性の高い推定値を得ることができます。
arXiv ページを見る PDF を見る コレクションに追加
このペーパーをエージェントで取得するには:
hf papers read 2607.02032
最新の CLI をお持ちでない場合は、curl -LsSf https://hf.co/cli/install.sh | bash を実行してください。
この論文を引用するモデル 0
本論文へのリンクを持つモデルはありません
このページからリンクするには、モデルの README.md に arxiv.org/abs/2607.02032 の引用を追加してください。
この論文を引用するデータセット 1
[## neulab/pace-bench
ビューアー • 約 23 時間前に更新• 412 • 169 • 1](https://huggingface.co/datasets/neulab/pace-bench)
この論文を引用するスペース 0
本論文へのリンクを持つスペースはありません
このページからリンクするには、スペースの README.md に arxiv.org/abs/2607.02032 の引用を追加してください。
この論文を含むコレクション 5
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み