動画記事 · LangChain
LangSmith が月間 3 億回のエージェント実行を管理する仕組み
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Clay は月間 3 億回のエージェント実行を LangSmith で管理し、品質評価、コスト最適化、スケーラブルな観測を実現する実装事例を紹介。
LangSmith が月間 3 億回の AI エージェントを管理する、スケーラブルな運用の秘訣
AI エージェントが単なる実験室のプロトタイプから、本番環境で信頼されるビジネスツールへと進化するために必要なものは何か。LangChain の CEO ハリソン・チェイと、AI 活用企業 Clay の創設者ジェフ・バーグは、月間 3 億回ものエージェント実行を管理し続ける LangSmith の仕組みについて語りました。
彼らが明らかにしたのは、大規模運用における「観測可能性(Observability)」の重要性です。単にコードを書くだけでなく、開発初期からトレーシングを組み込み、モデル非依存のアプローチでコストと品質を最適化する戦略が、エンタープライズ AI 導入の鍵となります。
月間 3 億回の実行を支えるインフラ戦略
Clay は、企業リスト作成やリード生成など、成長のための創造的なツールを提供する企業です。彼らの業務には、AI エージェントが深く組み込まれています。例えば、ウェブページをスクレイピングして洞察を引き出したり、顧客に合わせたアウトバウンドメッセージを作成したりする自律的なエージェントが稼働しています。
「月間 3 億回のエージェント実行があります」
これは非常に大規模なスケールです。平均して 1 つのエージェント実行には 30 ステップもの複雑なワークフローが含まれており、ウェブ検索やページクロールなどが組み合わされています。この規模を維持するためには、単なるプロトタイプ段階のアーキテクチャでは不十分です。
Clay が重視しているのは、エージェントが実行される際の「品質」「スループット(処理能力)」「コスト」の 3 つのバランスです。特に本番環境では、ユーザーが入力するテキストが自由であるため、エラーやレイテンシが発生するリスクも高まります。そのため、何が起きているかを深く理解し、根本的な品質問題やスタック内の失敗箇所を特定できる基盤が不可欠でした。
品質評価とコスト最適化の両立手法
大規模なエージェント運用において、品質をどう測定するかは最大の課題の一つです。Clay は、単一の指標に頼らず、複数の評価手法を組み合わせています。
- 決定論的マッチング: 構造化された出力に対して、正解(グラウンドトゥルース)と比較する完全な一致を確認する方法です。事実ベースのタスクにおいて有効です。
- LLM-as-a-judge: LLM 自体を審査員として使い、回答の質を採点する方法です。研究や長文要約など、正解が一つに定まらないタスクで威力を発揮します。
「コストとスループットの面で現在どこにいるかについて、LangSmith を使って実際にオフラインでベンチマークし、比較しています」
この多角的な評価により、Clay はコストをかけずにスループットを最大化する最適なバランス点を見つけ出しています。また、新しいモデルが登場した際にも、「コストがかかるがワークフローに適しているか」という観点から、迅速に適合性を判断できる体制を整えています。
開発の「Day Zero」からトレーシングを導入
LangSmith の導入時期こそが、この成功の大きな要因です。Clay では、エージェントの開発を始める「ゼロ日目(Day Zero)」からトレーシングを標準化しています。
「トレースをいつオンにするかというプロセスは? それはゼロ日目です」
自社でツールを開発するのではなく、LangChain が提供する LangSmith を利用したことで、導入初日から AI SDK を使った 1 行の変更でトレースをエクスポートできる環境が整いました。これにより、複雑なサブエージェントの階層構造や、LLM パスの挙動を可視化しやすくなりました。
この早期導入の効果は計り知れません。本番環境に投入する前にエラーを検出したり、顧客間の共通パターンを理解したりすることが可能になりました。現在はエンジニアリングチームだけでなく、サポートチームも LangSmith を活用してトレース分析を行い、顧客の信頼維持やダウンタイム防止に貢献しています。
モデル非依存と自動マッピングの実現
OpenAI や Anthropic など、複数のモデルプロバイダに対応する際、Clay は「モデル非依存(Model Agnostic)」なアプローチを採用しています。ユーザーによって好まれるライティングスタイルや用途が異なるため、一律のモデル選定では対応しきれません。
そこで活用されているのがメタプロンプターによる自動マッピングです。この仕組みは、各モデルの特性を学習し、ユースケースに応じて最適なモデルを自動的に選定・割り当てます。新しいモデルを追加する際も、このツールにマッピング情報を追加するだけで対応可能となり、スケーラビリティを確保しています。
未来のエージェント運用における「観測可能性」
今後、エージェントはより長時間実行され、より多くのステップを踏むようになります。また、コーディングエージェントが自己修復を行うような複雑なワークフローも登場します。
「スケール展開された環境で何の振る舞いが発生しているかを理解することは、初期製品の構築段階でも役立ちますが、スケール展開時にはそれができません」
小規模な段階では手動での確認も可能ですが、月間 3 億回の実行が起きるようになると、すべてのエージェントの挙動を手動で追うことは不可能です。LangSmith のような専用ツールによる「観測可能性」は、ユーザーの行動パターンを分析し、エージェントが示す異なる振る舞いを理解するための唯一の手がかりとなります。
さらに、メモリ機能を活用して時間経過とともにスキルを改善する仕組みや、システム・オブ・レコードとしてのログ管理など、長期的な視点での学習と適応も期待されています。Clay の事例は、単なるプロトタイプ開発から本番環境での信頼性確保へと移行するための、具体的なプラクティスを提示しています。
まとめ
月間 3 億回のエージェント実行を安定して管理する Clay の成功には、「観測可能性」への早期投資と、多角的な評価・最適化戦略が不可欠でした。LangSmith を活用することで、コスト管理や品質保証を自動化し、大規模な AI エージェント運用における信頼性を確保しています。これから AI エージェントを導入・運用しようとする企業にとって、この「Day Zero からのトレーシング」という視点は、本番環境での成功に直結する重要な示唆となるでしょう。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。