ページを読み込み中…
ページを読み込み中…
14件の記事
LangChain は、リポジトリの文脈と実行トレースを活用して評価(Eval)を構築するエンジニアリングスキルを発表した。これにより、AI アプリケーションの品質検証が効率化される。
LangChain がエンジン評価のための新しいベンチマーク「IssueBench」を発表した。これは開発者が AI エンジンの性能を客観的に比較・検証するためのツールである。
AI エディタ「Cursor」の性能を評価するベンチマークテスト「CursorBench」がバージョン 3.1 に更新された。このアップデートにより、コード生成やデバッグ能力に関する新たな評価基準が導入され、開発者の生産性向上に寄与する可能性が示されている。
LangChain が、エージェントの評価を一元化するための新しいプラットフォーム「Harbor」との連携を発表し、開発者がエージェントのパフォーマンスを効率的に検証できる環境を提供する。
マイクロソフトは開発者がテキスト記述を用いて AI の動作テストを迅速に構築・実行できる新しいツールの提供を開始した。