ページを読み込み中…
ページを読み込み中…
40件の記事
Hugging Face は LLM の性能がハルネスに依存することに着目し、AI による改善を評価する共通ベンチマーク「HarnessOpt-Bench」を発表した。
Hugging Face は、LLM エージェントが EC 業務で目的を一貫して維持する能力を評価するベンチマーク「MerchantBench」を発表した。
既存評価で見落とされやすい手足融合や身体貫通といった欠陥を検出する新ベンチマーク MPIE-Bench を導入した。
ベクトルデータベースの Pinecone が、自社のシステム性能評価に用いるベンチマークパイプラインの詳細構造と運用方法を公開した。
知識労働向けの現実的なデータ収集タスクに焦点を当てたオープンベンチマーク「WANDR」が発表された。これは、事実性を損なわずに広範な発見を継続できる研究エージェントを評価・測定するための枠組みである。