読み込み中…
読み込み中…
Coinbase の開発者プラットフォームチームは、Discord や Slack でのサポート対応をスケーラブルにするため、AI エージェントを活用したシステムをゼロから構築しました。このシステムは、LangSmith を用いた詳細なトレーシングと RAG フォールバック機構により、セキュリティと精度を担保しつつ、人間のフィードバックを含めて継続的に改善されています。また、エージェントエンジニアリングを独立した専門分野として捉え、観測可能性(Glass Box)の構築を最優先するべきという重要な教訓が示されています。
AI エージェントの実運用における「観測可能性」の重要性と、セキュリティを担保しつつスケーラビリティを実現する具体的なアーキテクチャが学べる貴重な登壇です。開発者体験(DX)向上のための AI 導入を検討しているチームに強く推奨します。
Discord や Slack での顧客対応を自動化するため、Python サービスと LangSmith を活用したトレーシング基盤を構築し、MCP と RAG の組み合わせで柔軟性と信頼性を両立させた。
機密データへのアクセス制限や誤った回答を防ぐため、決定論的なガードレールと軽量モデルによる出力評価を組み合わせて安全な自動応答を実現した。
LangSmith のトレースデータを分析し、自然言語での信号検索やバックテストを行うことで、システムの弱点を特定して自動的に強化するフィードバックループを確立した。
この事例は、大企業における AI エージェントの実装において、単なるチャットボットの導入ではなく、観測可能性とセキュリティを基盤とした堅牢なシステム設計の重要性を示しています。特に、人間のフィードバックを組み合わせた自己改善型ループの構築手法は、他のエンタープライズ企業が同様のスケールを目指す際の重要なベンチマークとなります。
Coinbase の開発者プラットフォームチームは、Discord や Slack でのサポート対応をスケーラブルにするため、AI エージェントを活用したシステムをゼロから構築しました。この事例は、単なるチャットボットの導入ではなく、「観測可能性(Glass Box)」とセキュリティを基盤とした堅牢な設計がいかに重要かを浮き彫りにしています。
Coinbase の開発者コミュニティは、暗号資産 API やウォレット、決済インフラなど、オンチェーン経済を支える重要な層です。長年、このコミュニティへの対応は Discord サーバー上での人間同士のやり取りが中心でした。
初期の AI チャット導入時は、ドキュメントの陳腐化や利用状況の可視化不足といった課題に直面しました。「ダウンボートや thumbs down を手動で数える」しかなく、システムが本当に機能しているのか把握できない状態だったのです。チームは、顧客満足度を維持しながら自動化レベルを高めるという目標のもと、既存のインフラを最大限活用しつつ、新しい能力を持つエージェント基盤の構築に着手しました。
Coinbase が選んだのは、従来のチャットボットの延長線上ではなく、Python サービスをファーストクラスインフラとして扱うというアプローチです。これにより、Discord や Slack といった顧客が待ち受ける場所だけでなく、バックエンドにはサポートエンジニア向けの強力なツールを提供する環境を整備しました。
このシステムの中核を担うのが、チームで初めて構築された Python サービスと、自前でホストした LangSmith です。LangSmith を用いた詳細なトレーシング(追跡)機能により、エージェントの挙動をリアルタイムで監視・分析できる基盤が完成しました。
「観測可能性は後付けの機能ではありません。それはすべての土台であり、他の機能が実装されるための出発点です」
また、外部 MCP(Model Context Protocol)サーバーを利用したドキュメント検索機能も実装しましたが、顧客向けのエージェントでは信頼性が不安定になるリスクがありました。そこで採用されたのが RAG(Retrieval-Augmented Generation:検索拡張生成) のフォールバック機構です。
「MCP が不安定な場合のために、ベクトルデータベースにフィードする基本的なナレッジパイプラインを RAG フォールバックとして用意しました。これにより、ツール自体の A/B テストも可能になります」
この組み合わせで、柔軟性と信頼性の両立を実現しています。
AI エージェントが顧客に直接応答する際、機密データへのアクセスや誤った回答のリスクは常に付きまといます。Coinbase はこれを防ぐため、二重のセキュリティ対策を講じています。
まず第一に、決定論的なガードレール(安全弁) を実装し、トランザクションの実行や機密データの取得といった危険な操作へのアクセス自体をブロックしています。
第二に、生成された回答の内容自体を検証する仕組みです。出力に対して軽量モデルを用いた LLM 評価(LLM judgment)を適用し、回答の正確性とリスクレベルを判定します。これにより、人間が介在する前に安全な自動応答が可能になっています。
「エージェントにはトランザクション権限や機密データへのアクセス権を与えていませんが、それでも misuse(悪用)を検知・防止するための細心の注意が必要です」
システムを一度構築して終わりではありません。Coinbase は LangSmith のトレースデータを分析し、「バックテスト」 と呼ばれる手法でシステムの弱点を特定・強化するフィードバックループを確立しました。
具体的には、過去のチャット履歴(ターン)をランダムまたは決定論的な方法でプロファイリングし、自然言語を用いて特定の信号を検索します。例えば、セキュリティダッシュボードの再検証を通じて、セキュリティだけでなくシステム全体の堅牢性を高めるためのシグナルを発見した事例もあります。
また、予期せぬ課題にも迅速に対応しました。多言語での対話が発生したことや、敵対的なデータセット(adversarial dataset)の生成が規約上の理由で困難だったことなど、現場の声を拾い上げながらシステムを洗練させています。
「LangSmith CLI と Claude Code を組み合わせてトレースデータを調査し、改善のための信号を見つけ出す。これが自然言語でのシステム調査であり、継続的な強化の鍵です」
このプロジェクトから得られた最大の教訓は、「エージェントエンジニアリングを独立した専門分野として捉える」 ことです。
Coinbase のチームは、プロダクトエンジニアリングと ML(機械学習)の両方の視点をバランスよく持つ人材を集め、組織全体でその強みを発揮する体制を整えました。また、人間が介在する「Human-in-the-loop」の仕組みを構築し、トークンコストや解決までのプロセスまで詳細に追跡可能にするなど、AI と人間の協業による効率化を図っています。
「エージェントエンジニアリングは独立した専門分野です。プロダクトと ML の両方の視点をバランスよく持つチームこそが、AI を活用して驚異的な成果を生み出せます」
Coinbase の事例は、大企業が AI エージェントを実装する際、単なる機能追加ではなく「観測可能性の構築」を最優先し、人間のフィードバックを組み合わせた自己改善型ループを設計することの重要性を示しています。これは、他のエンタープライズ企業にとって極めて重要なベンチマークとなるはずです。
この記事はAIが動画の内容を記事化したものです。正確な発言は動画および文字起こしをご確認ください。