読み込み中…
読み込み中…
Salesforce のチームは、LangChain の LangSmith を利用して、独自に開発していた MCP ツールの出力品質を保証する課題を解決しました。 LangSmith により、数千ものテストケースをスケーラブルに実行し、各チームが共通の評価基準(指示従順性、一貫性、事実性など)でコードを検証できるようになりました。 その結果、2025 年 10 月にローンチされたエンタープライズ製品「Agent Force」は、1 億行以上のコード受諾というマイルストーンを達成しています。 この事例は、大規模な AI エージェント開発において、品質ガバナンスと標準化の重要性を示す具体的な成功例です。
AI エージェントの実装における「評価(Evals)」の重要性と、それをどうスケーラブルに運用するかという実務的な知見が得られる貴重なケーススタディです。開発チームの品質ガバナンス構築を検討している方へ強く推奨します。
各チームが独自に評価を試行錯誤するのではなく、LangSmith を用いて共通の評価基準を設定し、品質を統一している。
LangSmith のトレーシング機能により、数千ものテストケースを事前に実行し、顧客提供前に不具合を検出・改善できる。
指示従順性、一貫性、事実性、デプロイ可能性など、多角的なメトリクスを用いてコード生成品質を厳格に測定している。
この動画は、大規模なエンタープライズ AI エージェント開発において、品質管理の自動化と標準化が不可欠であることを示しています。LangSmith のようなツールが、組織内のナレッジ共有を促進し、開発スピードとコード品質の両立を実現する鍵となることを証明しました。
Salesforce は 2025 年 10 月、エンタープライズ向け AI コーディング製品「Agent Force」をローンチし、わずか数ヶ月で受諾されたコード量が 1 億行を超えるという驚異的なマイルストーンを達成しました。この大規模な成功の裏には、各チームがバラバラに試行錯誤していた評価プロセスを LangSmith で標準化・自動化した戦略がありました。
Agent Force の開発以前、Salesforce 内の各チームは独自に MCP(Model Context Protocol)ツールを開発し、メタデータの生成やアプリ構築の部品作成を行っていました。しかし、大きな課題がありました。「それぞれのチームが作ったツールが、本当に期待通りの出力を出しているか」をどう保証するかです。
「各チームが自分たちだけで解決策を探そうとしていたのが問題でした」
当時の状況では、評価方法も基準もチームごとにバラバラで、属人化が進んでいました。これを打破したのが LangChain の「LangSmith」の導入です。LangSmith を採用することで、組織全体で共通の評価基準を設定し、品質を統一することが可能になりました。
LangSmith の最大の強みは、そのスケーラビリティにあります。開発者は数千ものテストケースを事前に実行し、顧客に提供する前に不具合を検出して改善できます。
「LangSmith は、各チームが毎回ゼロから評価方法を考え直す必要をなくしました」
従来の手法では、各チームが独自にテストを構築する必要があり、リソースの浪費や品質のばらつきが生じていました。しかし、LangSmith のトレーシング機能を使えば、なぜ予期せぬ出力が出てしまったのかを詳細に追跡し、改善点を特定できます。これにより、組織内の専門知識が増幅され、同じ構造とテストを共有することで、開発スピードとコード品質の両立を実現しました。
単に「動くか動かないか」だけでなく、AI エージェントとしての質を多角的に測るための具体的な指標が定義されました。LangSmith を通じて、各チームは以下の基準でコード生成品質を厳格に評価しています。
これらのメトリクスを LangSmith で可視化・管理することで、「各チームが同じ基準で評価している」という信頼性が生まれました。これにより、組織全体としてのコード品質の底上げが可能になったのです。
1 億行という受諾コード量は、単なる数字の達成ではなく、LangSmith を活用した「品質ガバナンスと標準化」の勝利を象徴しています。大規模なエンタープライズ AI エージェント開発において、ナレッジ共有を促進し、評価プロセスを自動化・標準化するツールが不可欠であることを証明した事例です。
この記事はAIが動画の内容を記事化したものです。正確な発言は動画および文字起こしをご確認ください。