ページを読み込み中…
ページを読み込み中…
8件の記事
Arize AI は、大規模データセットを迅速に評価する LLM 判定器の信頼性を検証するためには、単一の数値ではなく、タスクの定義や評価基準の適用範囲、誤り箇所を個別に分析する必要があると報告した。
TLDR AI は、エージェント開発におけるコストが検証に移行した現状を指摘し、Compound Engineering のプラグイン「/ce-dogfood」が人間を超えるスピードで検証ループを閉じる仕組みと、その役割を担うペルソナ戦略について解説している。
GitHub が新機能として、テストカバレッジが設定した閾値を下回った場合にプルリクエストのマージをブロックするブランチルールセットを提供し始めた。これにより開発チームはマージ時の品質ゲートを実現できる。
ラングエクス(LangSmith)というツールを用いて、AI アプリケーションの変更が既存の機能に悪影響を与えないかを確認する回帰テストの実施方法について解説している。