ページを読み込み中…
ページを読み込み中…
5件の記事
AI エージェントの信頼性を高めるための行動仕様を記述するオープン標準「Agent Behavior」が発表され、レビューや評価ケース作成に活用できる Markdown 形式の仕様が提供された。
LangChain が、深層型 AI エージェントの性能評価を行うための新しいベンチマーク手法を発表した。
Apple Machine Learning は、大規模言語モデルやコーディングエージェントが生成したユーザーインターフェースの視覚・インタラクション設計能力を、既存の手動または自動評価よりも正確かつ効率的に測定する「FlowEval」という参照ベースの評価フレームワークを発表しました。
Google は、プロンプト修正が本番環境に広範な回帰を引き起こす懸念に対処するため、データ準備から推論実行、評価までの5段階評価サイクルを自動化する新しい開発者スキルを発表した。
LangChain が開発した LangSmith Engine を発表し、LLM アプリケーションの構築・デバッグ・監視機能を強化するツールを提供しました。