ページを読み込み中…
ページを読み込み中…
8件の記事
Sourcegraph は、コード検索の改善がタスク完了やコスト削減に直結しないとし、自社のコードベースで検索精度、エージェント性能、コストを混同せずに測定する方法を示した。
AI評価専門家ハメル・フサイン氏は、多くのチームが製品自体の設計欠陥を無視して評価指標やデータセットに注力し、評価前に本質的な質問に答えていないと指摘した。
既存評価で見落とされやすい手足融合や身体貫通といった欠陥を検出する新ベンチマーク MPIE-Bench を導入した。
研究機関 METR が、AI エージェントの能力を定量的に評価するための新しい指標体系「Metrics of Agent Ability」を発表した。
Apple Machine Learning は、純粋な視覚的文脈からの推論が苦手な現状に対し、画像セットから共有概念を推論し適用する能力を評価する新タスク「VICIS」を導入したと発表した。