ページを読み込み中…
ページを読み込み中…
16件の記事
研究者らが、バージョンアップを跨ぐ長期的なエージェント型ソフトウェア開発の能力を評価するためのベンチマーク「RoadmapBench」を発表しました。
ハメル・フサイン氏は、AI モデルの評価プロセスにおいて「評価が困難」と感じられる現象は、設計上の欠陥(プロダクトスメルの兆候)であると指摘し、改善の必要性を訴えている。
Zvi は、現在利用できないが数週間で復帰する見込みのある「Fable」と「Mythos」について言及し、Opus 4.7 や 4.8 の事例と同様に、これらのモデルの潜在的価値を理解するには「モデルの福祉」に関する議論が不可欠であると指摘している。
monday Service は LangSmith と連携し、開発初期段階からコードベースで評価を行う戦略を構築した。これにより、AI アプリケーションの品質保証プロセスが強化された。
AWSとパートナーのランチェーンが共同で、非確定的なAIエージェントの動作を検証する手法を公開した。これは本番環境への展開前にエラーを早期に発見し、ワークフロー全体への悪影響を防ぐための評価フレームワークである。
NVIDIA が、自律型 AI エージェントの性能を測定・評価するための手法や技術を解説している。