動画記事 · LangChain
Clay の評価スタック:3 億回のエージェント実行、LangSmith パイプライン
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Clay は月間 3 億回以上のエージェント実行を支えるため、LangSmith を活用した階層的評価スタックとデータレイク基盤を構築し、開発から本番環境へのフィードバックループを実現している。
Clay が月間 3 億回の実行を支える評価スタック:大規模 AI エージェントの品質保証と自律学習の秘密
B2B データプラットフォーム「Clay」は、月間に 3 億回を超えるエージェント実行と週に 10 万通以上のメッセージ処理をこなす大規模運用を実現しています。この圧倒的なスケールにおいて、手動での検証や単なるランダムなテストでは品質を保証することは不可能です。そこで Clay が構築したのが、開発から本番環境までを一貫してカバーする「多段階評価スタック」と、現場の知見を即座に学習ループへ還元する「自律的な改善サイクル」です。
3 億回の実行を支える「評価は必須」の時代
Clay が展開するエージェントには、Web 調査を行う「Claygent」と、営業ワークフローの構築・分析を担当する「Sculptor」があります。特に Sculptor は、単なるツールの一つではなく、ユーザーが Clay のデータを活用してビジネスを成長させるための主要なインターフェースへと進化しました。
「月間に 3 億回の実行や週に 10 万通のメッセージ処理が行われるようになると、個々のトレース(実行記録)を手動で確認したり、全顧客にヒアリングしたりすることは物理的に不可能になります。評価(Eval)はもはやオプションではなく、必須となりました。」
大規模な AI エージェントシステムにおいて、品質保証を確立するためには、開発者が安心して変更を加えられ、本番環境へのデプロイが安全に行えるような堅牢な評価基盤が必要です。Clay では、LLM を活用した自動判定やシミュレーションユーザーによるテストを導入し、人的リソースの限界を超えた品質管理を実現しています。
開発から本番までを網羅する「多段階評価戦略」
Clay の評価スタックは、単一の手法に依存せず、利用シーンに応じて異なるレベルの評価を階層的に設計しています。これは、開発者の負担を減らしつつ、本番環境の信頼性を最大化するための戦略です。
1. ローカル開発向け:高速・低コストなテスト
開発者がローカルでコードを変更した際に行う評価は、とにかく「速く」「安く」実行できることが求められます。ここでは複雑なサンドボックスや仮想ファイルシステム(VFS)を必要とせず、コマンドラインから即座に実行できる軽量な評価スイートを用意しています。
「開発者は LangChain の実験環境へ移動したり、新しいエージェントのプロビジョニングを行ったりする手間をかけたくありません。変更したコードがローカルで即座に評価され、結果がバージョン管理される仕組みこそが、開発フローを加速させます。」
2. CI/CD・ステージング環境:本番に近い厳密なテスト
一方、本番環境へデプロイする前のステージング段階では、実際の運用環境と同等の条件で評価を行います。ここでは、以下の 3 つのアプローチを組み合わせています。
- 構造化されたチェック(Structured Checks): 単純な「正解・不正解」を問うゴールドデータ(Golden Data)は、キーワードの順序変更などで誤判定されやすく、ノイズになりがちです。そのため、Clay ではクエリの重要な部分のみを対象とした、より柔軟で構造化されたチェックを採用しています。
- 軌道とツールアサーション: エージェントが正しい手順を踏んでいるかを検証します。例えば、「価格について質問されたら、実際に価格表を読み込んでいるか」といったツールの使用履歴や実行順序を確認します。
- 決定論的なマルチターン評価: 過去の実際の会話データを元に、AI が「ユーザー」役となってエージェントと対話するシミュレーションです。Clay の開発チームは、ランダムな AI ユーザーよりも、過去の事例から抽出した「決定論的(Deterministic)」なシナリオの方が、ノイズが少なく効果的であると発見しました。
3. 本番環境:客観指標と主観評価の融合
実際の運用では、Latency(応答速度)や Cost(コスト)、ユーザーがチャットから離れて他の機能へ移動する割合(滞留率)といった定量的な指標を監視します。同時に、LangChain のオンライン評価器を活用して、NPS(ネットプロモータースコア)や「ユーザーがエージェントの回答に修正を加えたか」といった主観的な満足度も測定しています。
評価精度の低下を防ぐ「ドリフト対策」とフィードバックループ
AI エージェントの評価において最大の課題の一つは、「評価ドリフト(Eval Drift)」です。モデルの更新や、実際のユーザーの利用パターンがテストケースとズレてくることで、評価結果が実態を反映しなくなる現象です。
「データドリフト(本番での利用事例がテストと異なる)、ジャッジドリフト(LLM 判定器自体のバイアス)、そして過学習(特定の評価セットに最適化されすぎること)は、すべて評価精度を低下させる要因となります。」
これを防ぐため、Clay は以下の戦略を採用しています。
- 顧客サポートチケットの活用: 高品質なフィードバックとして、実際の顧客サポートチケットから事例を抽出し、評価セットに組み込みます。
- 人手による注釈データ: LLM のバイアスを補正するため、人間が手動で注釈をつけた「ゴールドデータ」を継続的に作成・追加しています。
- ユースケース分類の自動化: チェーン(Chain)やユースケース分類器を活用して、評価セットが実際の生産現場の多様な利用シーンをカバーしているかを自動でタグ付けし、網羅性を確保します。
データレイクと CLI による「自律的な学習ループ」
Clay の最終目標は、分散したデータソースを統合し、エージェント自身がデータを分析・改善できる環境を整えることです。そのために、彼らは「データレイクアーキテクチャ」への移行を進めています。
この基盤では、社内外の第一・第三パーティデータを統合し、エージェントが安全に大規模なデータ処理を行えるようになっています。具体的には、開発用と運用用の計算リソースを分離することで、新しいデータモデルの実験やデプロイが本番環境への影響なく行えます。
さらに、CLI(コマンドラインインターフェース)や API を公開し、Web UI でできることをすべてエージェントからも実行可能にしています。これにより、「内部エージェント」と「外部のサードパーティエージェント」が同じツールセットを利用する「フライホイール効果」を生み出しています。
「エージェントが CLI や API のツールを呼び出す際、失敗や不具合が発生した瞬間に、その情報が即座にフィードバックループに戻ります。これにより、ツールの改善とエージェントの学習が同時に進み、結果としてすべてのユーザー(内部・外部問わず)の体験品質が向上します。」
このように、Clay は単なる評価ツールを導入しただけでなく、現場の知見を即座に学習ループへ組み込み、自律的に進化し続けるシステムを構築しました。これは、大規模な AI エージェント運用における品質保証と継続的改善のための、業界全体が参考にするべき新たな標準モデルと言えるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。