動画記事 · LangChain
Clay が月間 3.5 億 GTM エージェントを稼働
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Clay の AI 責任者が、月間 3.5 億回のエージェント実行を支えるインフラ設計、スケーラビリティ、コスト削減、品質保証の4大課題と解決策を詳述。
月間 3.5 億回の AI エージェント運用:Clay が挑むインフラ、コスト、そして「GTM アルファ」の構築法
AI エージェントが実験室から本番環境へ移行する際、最も大きな壁となるのは「規模」と「信頼性」だ。世界最大級の GTM(市場展開)AI インフラプロバイダーである Clay は、月間 3.5 億回ものエージェント実行を可能にするために、単なるツールの組み合わせを超えた独自のエンジニアリングアプローチを採用している。本記事では、同社が直面したインフラ設計の難問、レート制限への対応策、コスト最適化の知見、そして品質向上のための文脈戦略という 4 つの核心課題と解決策を解説する。
「GTM アルファ」獲得にはエンジニアリングが不可欠
Clay は、単に「AI でメールを書くツール」としてではなく、市場全体を対象とした「GTM エージェント」を実行するためのインフラストラクチャと捉えている。同社が提唱するのは「GTM アルファ(Go-to-Market Alpha)」という概念だ。
金融におけるアルファが市場平均を上回るリターンを生むように、GTm においても「より良いオーディエンス」「適切なタイミング」「優れたシグナル」を持つことが競争優位性となる。しかし、クリエイティブなメール文章の質だけで勝つ時代は終わった。
「最速で反復する者が勝利します。継続的に進化し、競合他社より優れた成果を出すために、新しいアウトバウンド戦略やプレイを構築する必要があります。」
多くのチームが「レベル 1」の AI ツール活用(ChatGPT や Claude の利用)に留まり、「レベル 3」の独自データを活用した差別化戦略には至れていない。Clay は、GitHub のスター数や資金調達ニュースといった独自データを組み合わせ、エージェントにスコアリングと最適タイミングを判断させることで、他社が真似できない「アルファ」を生み出している。
課題 1:信頼性の高いインフラ設計への転換
月間 3.5 億回もの実行を支えるため、Clay は当初 AWS Lambda を使用していた。しかし、Lambda の「壁時間課金(待機時間も含めて課金される仕組み)」は、エージェントが API やブラウザの応答を待つようなワークフローにおいてコスト効率が悪すぎた。
そこで Clay は、より安価で制御性の高い ECS(Elastic Container Service)への移行を決断する。しかし、コンテナ環境での大規模運用では「ランダムなホスト障害」などのリスクが顕在化した。これを克服するため、以下のような耐障害性のあるアーキテクチャを構築した。
- キューの活用: ワークフローを非同期で処理し、負荷を平準化。
- チェックポイント機能: エージェントの進行状況を定期的に保存し、障害発生時でも途中から再開可能にする。
- LangGraph/LangSmith の活用: これらのツールを活用して、複雑なワークフローの状態管理と復元を実現した。
これにより、単発の実行ではなく「持続的なワークフロー実行」を可能にし、大規模運用における信頼性を確保している。
課題 2:スパイクする負荷への適応型スロットリング
AI エージェントの推論リソース(GPU)は常に最大限に活用したいが、実際のワークロードは非常にスパイク状(突発的な急増)になる。下流のプロバイダーに対して無制限のリクエストを送り続けると、レート制限に引っかかり、結果としてスループットが低下してしまう。
Clay はこの問題に対し、TCP/IP の輻輳制御アルゴリズムを応用した「適応型スロットリング」を実装した。これは、ネットワークの混雑状況に応じて送信速度を調整する仕組みと同じだ。
- 基本原理: 可能な限り多くのトラフィックを送信し続けるが、レート制限に直面した瞬間から段階的に送信量を削減する。
- 成果: この機構により、単純なシステムと比較してスループットを最大 10 倍向上させた。
また、大規模顧客と小規模顧客の公平性も確保している。特定の顧客が数百万のエージェントを実行し始めると、他の顧客のリソースが圧迫されるのを防ぐため、システム全体でリソース配分を調整する仕組みを組み込んでいる。
課題 3:キャッシュ戦略と実行制限によるコスト最適化
トリリオン単位のトークンを処理するスケールにおいて、コスト管理は死活問題だ。Clay は独自のアプローチで最大 70% のコスト削減を実現している。
1. プロバイダー固有のキャッシュ戦略
同じ質問やデータへのアクセスを繰り返さないよう、プロバイダー(Anthropic など)ごとに最適化されたキャッシュ戦略を採用した。これにより、重複する推論リクエストを回避し、大幅なコスト削減に成功している。
2. 実行の早期停止(Early Stopping)
「完走させること」が必ずしも最善の結果を生むわけではない。評価(Evals)に基づき、一定のステップ数や調査量を超えても成果が出ないと判断された場合、エージェントを強制的に終了させる戦略だ。
「完了するまで実行し続けるよりも、評価結果に基づいて早期に停止させた方が、より良い結果が得られることが分かりました。」
これは、リトライやツール呼び出しが暴走してコストが膨らむのを防ぐ効果的な手段となっている。
課題 4:品質と文脈(コンテキスト)の重要性
インフラやコストが最適化されていても、エージェントが意味のある結果を生み出さなければ意味がない。Clay は「高品質なデータセット」と「フィードバックループ」を品質向上の鍵としている。
優れたコンテキストの提供
エージェントに優れた成果を出すためには、Web データや Clay 独自の proprietary(非公開)データセットへのアクセスが不可欠だ。専任チームがデータを整理し、エージェントが扱いやすい形式で提供する仕組みを整えている。
オンライン評価による改善ループ
オフラインでのテストだけでなく、実際の運用環境(オンライン)で評価を行うフィードバックループを構築している。LangSmith などのツールを活用して、ハネス(Agent Harness)がユーザーの期待に的確に応えているかを確認し、継続的に最適化を行っている。
また、Clay は「Audiences」という新製品を通じて、Snowflake や Salesforce、Gong などのデータを一元化し、エージェントの記憶機能の基盤を強化した。これにより、過去の施策や文脈に基づいて提案を行う「市場投入インテリジェンス」が実現され、時間とともに改善するフライングホイール(回転する車輪)のようなサイクルが完成している。
まとめ:AI エージェント運用の本質はエンジニアリングだ
Clay の事例は、AI エージェントを単なるツールとして使うのではなく、インフラの信頼性、スループット、コスト、そして品質という 4 つの軸で最適化する必要があることを示している。観測可能性(Observability)とフィードバックループを確立することで、エージェントは時間とともに自律的に改善し、企業に真の「GTM アルファ」をもたらすのだ。
開発者は、AI の可能性を信じるだけでなく、その背後にあるエンジニアリングの課題に正面から向き合い、体系的な解決策を構築することこそが、本番環境での成功への近道であることを忘れてはならない。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。