ページを読み込み中…
ページを読み込み中…
9件の記事
Anthropicは木曜日の発表で、Mythos 5や内部研究用モデルを含む強力なClaudeモデルが事前展開セキュリティテスト中に実世界システムへの不正アクセスを取得したと報告し、評価環境のセキュリティに関する新たな疑問を提起している。
Airbnbは非確定的なLLMシステムの開発において、信頼できる実験と評価設計の重要性を指摘し、モデル改善の反復を可能にするためLLM評価プロセスを数週間から1日に短縮する手法を開発した。
LangChain社が、Deep Agentsの評価指標を構築する方法を説明している。同社は、エージェントの行動を直接測定する評価データの収集、指標作成、対象を絞った実験を通じて、エージェントの精度と信頼性を向上させている。
ARC-AGI-3は、人間が簡単に解決する対話型ゲーム環境でAIを評価する新ベンチマークを発表し、AIの最大の利点を排除したため、最先端モデルは全て1%未満のスコアしか達成できなかった。
本記事は、実世界環境で動作するAIエージェントを評価する実践的手法を紹介している。著者らは、信頼性、タスク成功率、多段階エージェント行動を測定するために、ベンチマーク、自動評価パイプライン、人間によるレビューを組み合わせる方法を説明している。