動画記事 · LangChain
Salesforce、LangSmithでエージェント評価を標準化
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
Salesforce は LangSmith を活用し、エンタープライズ向け AI エージェント「Agent Force」の品質評価を標準化し、1 億行以上のコード生成における一貫性と信頼性を確保している。
Salesforce の「Agent Force」が 1 億行突破!LangSmith が導いた品質革命
Salesforce は 2025 年 10 月、エンタープライズ向け AI コーディング製品「Agent Force」をローンチし、わずか数ヶ月で受諾されたコード量が 1 億行を超えるという驚異的なマイルストーンを達成しました。この大規模な成功の裏には、各チームがバラバラに試行錯誤していた評価プロセスを LangSmith で標準化・自動化した戦略がありました。
脱「属人化」:共通の評価基準で品質を統一する
Agent Force の開発以前、Salesforce 内の各チームは独自に MCP(Model Context Protocol)ツールを開発し、メタデータの生成やアプリ構築の部品作成を行っていました。しかし、大きな課題がありました。「それぞれのチームが作ったツールが、本当に期待通りの出力を出しているか」をどう保証するかです。
「各チームが自分たちだけで解決策を探そうとしていたのが問題でした」
当時の状況では、評価方法も基準もチームごとにバラバラで、属人化が進んでいました。これを打破したのが LangChain の「LangSmith」の導入です。LangSmith を採用することで、組織全体で共通の評価基準を設定し、品質を統一することが可能になりました。
スケーラブルなテスト実行:顧客提供前の不具合検出
LangSmith の最大の強みは、そのスケーラビリティにあります。開発者は数千ものテストケースを事前に実行し、顧客に提供する前に不具合を検出して改善できます。
「LangSmith は、各チームが毎回ゼロから評価方法を考え直す必要をなくしました」
従来の手法では、各チームが独自にテストを構築する必要があり、リソースの浪費や品質のばらつきが生じていました。しかし、LangSmith のトレーシング機能を使えば、なぜ予期せぬ出力が出てしまったのかを詳細に追跡し、改善点を特定できます。これにより、組織内の専門知識が増幅され、同じ構造とテストを共有することで、開発スピードとコード品質の両立を実現しました。
多角的な評価指標:5 つのメトリクスで厳格に測定
単に「動くか動かないか」だけでなく、AI エージェントとしての質を多角的に測るための具体的な指標が定義されました。LangSmith を通じて、各チームは以下の基準でコード生成品質を厳格に評価しています。
- 指示従順性 (Instruction Following): ユーザーの指示を正確に理解し、実行できているか。
- 一貫性 (Coherence): 出力が論理的につながり、矛盾がないか。
- 事実性 (Factuality): 生成された情報が事実に基づいているか。
- デプロイ可能性 (Deployability): 実際の環境で問題なく動作し、導入できるか。
これらのメトリクスを LangSmith で可視化・管理することで、「各チームが同じ基準で評価している」という信頼性が生まれました。これにより、組織全体としてのコード品質の底上げが可能になったのです。
まとめ:標準化がもたらす大規模 AI 開発の成功
1 億行という受諾コード量は、単なる数字の達成ではなく、LangSmith を活用した「品質ガバナンスと標準化」の勝利を象徴しています。大規模なエンタープライズ AI エージェント開発において、ナレッジ共有を促進し、評価プロセスを自動化・標準化するツールが不可欠であることを証明した事例です。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。