ページを読み込み中…
ページを読み込み中…
5件の記事
Browser Use Blog は、ベンチマーク結果を決定する評価者(Judge)が弱体だと報酬ハック可能になるため、一貫性を高めるための設計に注力したと報告している。
Arize AI は、大規模データセットを迅速に評価する LLM 判定器の信頼性を検証するためには、単一の数値ではなく、タスクの定義や評価基準の適用範囲、誤り箇所を個別に分析する必要があると報告した。
Hugging Face は、音声 AI の人間による品質を評価する指標「Real World VoiceEQ」を発表した。
Fireworks と LangChain は、Qwen-3.5-35B モデルをチャットデータで微調整し、ユーザーが特定するエラーを検出できる「知覚的エラー」判定器を開発しました。この手法により、最先端モデルに匹敵する性能を維持しながらコストを大幅に削減することに成功しています。
著者はコンサルティング経験から、多くのAIチームが複雑なアーキテクチャ構築に注力しすぎていると指摘する。重要なのは技術の詳細ではなく、そのシステムが実際に機能しているかを測定する方法である。