動画記事 · LangChain
LangSmith Engine の構築プロセス
動画の文字起こしと公開情報をもとにAIで要約・構成しています。 正確な発言は元動画と時間位置で確認してください。
まず要点
LangChain が公開した LangSmith Engine は、トレーシングデータから自律的に問題を特定し、修正コードを提案・PR を作成する自己改善型エージェントプラットフォームである。
LangSmith Engine の誕生:AI エージェント開発を「バグ叩き」から「自律改善」へ変える画期
LangChain は、AI エージェント開発の現場で長年悩まされてきた「手動でのバグ修正と監視」という課題に終止符を打つため、自律的な問題解決エンジン「LangSmith Engine」を発表しました。これは単なる監視ツールではなく、トレーシングデータを分析して実質的なエラーを特定し、プロンプトやコードの修正案を自動生成して GitHub PR として提出する、開発ループそのものを自動化するインフラストラクチャです。
「カブトムシ叩き」からの脱却:なぜ自律化が必要なのか
LangChain は自社でも GTM(市場投入)エージェントなどを運用しており、そこで直面したのが「マイクロ回帰」と呼ばれる問題でした。監視を徹底していても、顧客から「細かく見ると壊れている」という報告が絶えず、一つ修正すれば別の小さな不具合が見つかるという状態に陥っていました。
「これは『カブトムシ叩き』のようなゲームのようです。ここで問題を解決しても、別の問題がすぐに発生します。」
開発者が手作業でこれらの微細なエラーを見つけては修正し、さらにその都度評価用データセット(Evals)を作成するのは極めて非効率です。優先度の低い小さなバグが山積みになり、重要な機能拡張がおろそかになるという悪循環を打破するため、LangChain は「問題を発見し、修正し、テストを追加する」エージェント自体を構築することにしました。
Engine の実力:エラー特定から PR 自動生成まで
発表された LangSmith Engine の UI は、開発者が直面する課題を直感的に解決できるよう設計されています。左側のインボックスには、優先度順に並べられた問題リストが表示され、各項目には発生したタイムラインや詳細な説明が記載されます。
Engine は単にエラーを指摘するだけでなく、具体的な修復案も提示します。プロンプトの微調整から、エージェントファイルのコード変更まで、必要な修正内容が提案されれば、開発者はワンクリックで GitHub に Pull Request(PR)を作成できます。
「Engine は問題の診断だけでなく、実際に問題を修復する働きもします。」
また、本番環境で発生した失敗事例を基に、オンライン評価器(Online Evals)やオフライン用の正解データセット(Ground Truth)を自動的に生成する機能も備えています。これにより、開発者は手動で注釈をつける手間から解放され、品質保証プロセスが自動化されます。
アーキテクチャの核心:トレーシングこそが「魂」である
Engine の設計において最も重要視されたのは、「問題特定」と「修正生成」を分離したアーキテクチャです。当初はすべてのトレースをそのまま読み込ませていましたが、非確実性が高いエージェント開発において、膨大なコンテキストの中から意味のあるエラーを見極めることが困難でした。
そこで導入されたのが、LangSmith のトレーシングデータを活用する仕組みです。
「トレースこそが Engine が扱う中で最も価値のある入力であり、エージェントの魂への窓——実際の運用環境での振る舞いを示すものです。」
Engine はまず、凝縮・要約されたトレースを分析してパターンやエラーを検出し、その後に詳細な調査と修正を行います。このプロセスには、LangChain のディープエージェントフレームワークや LangSmith Sandboxes などの最新技術が裏側で動いています。
さらに、顧客ごとの優先順位に合わせた学習機能も実装されています。ある顧客にとって重要な「コスト削減」の指摘は、別の顧客にとっては無視すべきノイズである場合があります。Engine はこうした顧客のフィードバックを記憶し、表示される問題の優先度や無視するべき項目を動的に調整します。
評価(Evals)の自動化:高品質なエージェントへの道
Viv が強調するように、このエンジンが機能しているかを確認するためには「評価」が不可欠です。Engine は自らも Evals を作成しますが、そのためにはまず良質な評価基準が必要です。
LangChain は以下の 3 つのアプローチで評価スイートを構築しています。
- 内部トレースからの抽出: 実際にユーザーとして動作したデータ(Dogfooding)を基に初期データを生成する。
- 合成データと人間レビュー: LLM に評価例を生成させ、人間がその質をチェックしてルブリックを整える。
- コミュニティ評価: 外部の知見を取り入れつつ、自社エージェントに特化した評価設計を行う。
「高品質な Evals は、最終的に高品質なエージェントへとつながります。」
また、Engine は単なる修正ツールにとどまらず、モデル選定(コストとパフォーマンスのバランス)やプロンプトエンジニアリングの重要性も再認識させています。特に「プロンプトエンジニアリングは死んだ」という説に対し、LangChain は顧客の優先事項をエンコードする手段として、依然としてその重要性を強く主張しています。
未来への展望:自己改善型ループの実現
LangSmith Engine の真価は、開発者が手動で対応に追われる負担を減らし、エージェントが自律的に進化していく点にあります。すでに初期バージョンでは、エンジン自身が生成したトレースを分析して「コンテキスト管理の不備」や「モデルの使い分け」などの改善点を発見し、自身をアップデートする兆候も確認されています。
これは、AI エージェント開発における「観測(Observability)」と「評価(Evaluation)」の概念を、単なる監視ツールから自律的な改善エンジンへと進化させる画期的なステップです。業界標準となるインフラとして、開発者がより高品質なエージェントを迅速に構築・維持するための基盤を提供していくことが期待されます。
Original Source
元動画で発言を確認
プレイヤーは必要になるまで読み込みません。YouTubeのCookieと通信も再生を選ぶまで開始しません。
時間位置から根拠を確認
章や引用を選ぶと、元動画をその位置から再生します。