LangSmith で音声エージェントをトレース
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
LangChain Blog
LangChain は LangSmith に Python 統合機能を追加し、Pipecat や LiveKit など主要な音声エージェントフレームワークの追跡をネイティブサポートするようになった。
AI深層分析を開く2026年7月29日 05:18
AI深層分析
キーポイント
主要フレームワークのネイティブサポート開始
LangSmith が Pipecat, LiveKit, OpenAI Realtime, Gemini Live (Google ADK) の 4 つの音声エージェントフレームワークに対する Python 統合を正式にリリースした。
音声特有の観測機能の実装
会話オーディオの録音、音声認識・合成推論の追跡、割り込みイベントのハイライトなど、テキストベースとは異なる音声エージェント固有の要件に対応した機能が追加された。
サンドイッチ型アーキテクチャへの対応
STT、LLM、TTS の 3 つのコンポーネントを連鎖させる「サンドイッチ」型アーキテクチャにおいて、各ステップのメタデータやレイテンシ詳細を可視化する観測機能が提供される。
テキストと音声の統合管理
開発者は LangSmith 上でテキストエージェントと音声エージェントを一つの場所で管理し、既存のレビュー・コラボレーションワークフローをそのまま適用できるようになる。
サンドイッチ型と音声対話型の両方に対応
LangSmith は従来のテキストベースエージェントを挟むサンドイッチ型と、多モーダルモデルを用いた音声対話型の両方のアーキテクチャをトレース可能である。
重要な引用
Today we're launching Python integrations to trace four popular voice agent frameworks in LangSmith: Pipecat, LiveKit, OpenAI Realtime, and Gemini Live with the Google ADK.
Voice agents are getting more practical and the market for voice agents is growing quickly.
Now, your text and voice agents can live in one place, under the same review and collaboration workflows you've already set up in LangSmith.
With LangSmith, you can trace both architectures and get full observability into your production conversations.
編集コメントを表示
編集コメント
音声エージェントの実用化が加速する中、開発プロセスの可視性を確保するための重要なツール更新である。特に、オーディオデータの追跡やレイテンシ分析機能を標準サポートすることで、複雑な音声パイプラインの開発・運用コストを大幅に削減できる可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

本日、LangSmith で 4 つの主要な音声エージェントフレームワーク——Pipecat、LiveKit、OpenAI Realtime、そして Google ADK を用いた Gemini Live——をトレースするための Python インテグレーションを発表します。
音声エージェントは実用性が高まりつつあり、市場も急速に拡大しています。この成長は技術スタック全体での進歩によって支えられています。音声活動検出モデルの精度向上により、不要な中断や不自然な対話が減り、音声生成モデルはより感情豊かで自然な声を実現しています。また、大規模言語モデル(LLM)も高速化・知能化し、リアルタイムでの会話が可能になっています。
音声エージェントにも可観測性が不可欠
音声エージェントの構築は、チャットベースのエージェントと多くの点で共通しています。どちらもモデルを呼び出し、ツールを活用し、状態を維持し、文脈を取得し、意思決定を行います。本番環境で音声エージェントをスケールさせるには、パイプライン内のあらゆる時点での状況を可視化できることが必要です。さらに、チームメンバーとのトレース共有、エージェントの行動評価、エラーのデバッグ、そして時間経過に伴う改善——これらはテキストベースのエージェントと同様に重要です。
ただし、音声のトレースや監視には特有の要件が存在します。今回のリリースでは、会話音声を録音したり、音声からテキストへ、あるいはテキストから音声への推論をトレースしたり、中断を検出したりといった機能をネイティブサポートとして追加しました。
これで、テキストエージェントと音声エージェントを同じ場所で管理できるようになりました。LangSmith で既に設定済みのレビューやコラボレーションワークフローをそのまま活用できます。

音声エージェントのアーキテクチャ
音声エージェントを構築する主なアーキテクチャには、「サンドイッチ型」と「音声対音声型」の 2 つがあります。
「サンドイッチ型」では、エージェントは音声テキスト変換(STT)、テキストベースのエージェント、音声合成(TTS)という 3 つの推論コンポーネントを連鎖させて構成されます。1 トークンごとにこれら 3 つのコンポーネントを順に通過します。具体的には、ユーザーの音声が文字起こしされ、そのテキストが従来のテキストベースのエージェントに入力として扱われ、エージェントからの出力が再び音声に変換されてユーザーに再生されます。
「サンドイッチ型」の音声エージェントで優れた観測性を確保するには、パイプラインの各ステップに関する洞察を捉えられることが重要です。具体的には、各推論リクエストからのメタデータや入力・出力データの取得、STT、LLM、TTS 間のレイテンシの内訳を分析して遅延の原因箇所を特定すること、音声活動検出(VAD)イベントの追跡などが含まれます。
一方、音声対音声アーキテクチャでは、エージェントはオーディオ入力を処理し、ネイティブにオーディオ出力を生成するマルチモーダルモデルを用いて構築されます。このアーキテクチャを採用すると、音声エージェントアプリケーションは双方向の WebSocket を介してストリーミングされるイベントで構成されます。具体的には、ユーザーの音声を表すオーディオイベントをモデルへ送信し、モデルからはツール呼び出し、中断検出イベント、文字起こし結果、オーディオ出力などが返されます。
音声対音声の場合、ネットワーク上で送受信するイベントをキャプチャして確認する必要があります。これらのイベントは、音声エージェントのやり取りにおける正解(グランドトゥルース)を再構築したり、アプリケーションのデバッグを行ったりする際に不可欠だからです。
LangSmith を使えば、両方のアーキテクチャをトレースでき、本番環境での会話に関する完全な可観測性を確保できます。
音声トレースの分解
新しいトレーシング統合機能により、LangSmith は各本番トレースからの主要な実行(run)をすべてキャプチャします。各トレーシング統合は数行のコードで設定でき、音声インタラクション中に何が起こったかについて完全な可観測性を提供します。具体的には以下が含まれます:
- トレース上に重ねて表示される会話全体のオーディオ
- 入力、出力、その他のメタデータを含む音声から音声へのモデルイベント
- レイテンシやその他のメタデータを含む音声認識推論のトレース
- レイテンシやその他のメタデータを含むテキスト読み上げ推論のトレース
- ユーザーとエージェントのやり取りをまとめた高レベルのターン
- 発話活動検出イベント
- 割り込みや重なる音声の記録
- モデルへの入力と出力
- ツール呼び出し、引数、結果、およびエラー
- 音声パイプライン各段階におけるタイミング
捕捉した各イベントと作業単位は単一のトレースツリーに表示され、インタラクションがオーディオからエージェントのアクション、そして発話による応答へとどのように移行したかを追跡できます。
エージェントの実際の動作を確認する
エージェントエンジニアリングプラットフォームである LangSmith は、開発者がすべてのエージェント判断をデバッグし、変更の評価を行い、ワンクリックでデプロイできるように支援します。
AI算出
主要ニュースainew評価高い
AI エージェント運用における可観測性の重要な拡張であり、特定のアーキテクチャ(サンドイッチ型・音声対音声)やフレームワーク(Pipecat, LiveKit など)への対応という実装詳細を含むため、新規性と関連性は高い。ただし、日本固有の事例や規制情報は含まれていないため、日本の関連性は低めとなる。
6つの評価軸を見る
- AI関連度
- 75
- 情報源の信頼性
- 100
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み