ページを読み込み中…
ページを読み込み中…
13件の記事
自律型エージェントが長期実験を通じてモデルやシステムを改善する能力について、最終スコアだけでなく進捗の所在や経験の蓄積効果を検証する新しい評価フレームワークを提案し、7 つの最先端モデルを対象に 36 の長期タスクで体系的に評価した。
AI モデルの能力を特定の高レベル機能で測定するタスクとスイートを管理・実行するための評価フレームワーク「smevals」が、GitHub リポジトリとして公開された。
KDnuggets が、言語モデルの幻覚現象を検出・評価するための手法「GraphEval」について紹介している。
AWSはMotorway社との共同事例を基に、StrandsとAgentCoreを活用したAIエージェントの評価・実装に関する生産用ブループリントを発表した。
MarkTechPost は、16GB GPU でも動作する Lift ベンドエンドを用い、研究 PDF から構造化データへ変換するワークフローと、制御された評価手法を解説している。