ページを読み込み中…
ページを読み込み中…
8件の記事
AI評価専門家ハメル・フサイン氏は、多くのチームが製品自体の設計欠陥を無視して評価指標やデータセットに注力し、評価前に本質的な質問に答えていないと指摘した。
Anthropic の技術スタッフである Marius Buleandra 氏は、本稿で生産環境でも機能する AI エージェントの評価手法について、モデル性能向上の誤認を防ぐための具体的な指針を示した。
Booking.com は、旅行の各段階で利用される多数のシステムを運用するため、大規模な AI 観測性を必要とし、Arize を活用してその実現を図った。
3 つの研究により、優れたスキルは最長の文書や巧妙なプロンプトではなく、反復する失敗を修正する手続き的専門知識であることが示された。
Arize と Fireworks は、Kimi K3 を含む 10 のオープンおよびクローズドモデルを対象に、40 の実エージェントタスクで 2,400 回実行し、成功率や再試行回数、カバレッジ、成功タスクあたりのコストを測定した。