ページを読み込み中…
ページを読み込み中…
7件の記事
Google は Gemini Enterprise Agent Platform の評価サービスを一般提供(GA)とし、開発者がローカル実験と本番トラフィックの両方でエージェント品質を一貫して測定できる統合エンジンを提供するようになった。
Apple Machine Learningチームは、複数の大規模言語モデル(LLM)で構成される評価パネルの信頼性について調査した。その結果、9つの最先端モデルからなるパネルでも、相関する誤差により実質的な有効投票数は約2票に過ぎないことが判明した。
ライドシェア企業の Lyft が、LangChain の LangGraph と LangSmith を利用し、開発者が独自に AI エージェントを構築・管理できるセルフサービスプラットフォームを構築した手法について紹介している。
研究者らが、大規模言語モデルを評価者として用いる手法を改善し、その判断基準が人間の実際の嗜好と一致するよう調整する新しいアプローチを発表した。
AIエージェントの構築において、OpenEvalsとLangfuseを活用したマルチターン(複数回の対話)評価の重要性と始め方を紹介しています。