NVIDIA、対話型AI向けリアルタイム全二重音声モデル「VoiceChat」公開
本文の状態
日本語本文は品質確認中
読みづらい抽出結果は公開せず、要点と原文を案内します。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
NVIDIA は、音声理解と生成を統合した 11B パラメータのオープンソースフルデュプレックスモデル「NemotronLabs VoiceChat」を発表し、リアルタイムなツール呼び出し機能を実装した。
AI深層分析を開く2026年8月5日 23:48
AI深層分析
キーポイント
ユニファイドアーキテクチャによる低遅延化
従来の ASR→LLM→TTS のカスケード型ではなく、音声信号を直接処理する単一モデルで構成され、エンドツーエンドの遅延を大幅に削減している。
リアルタイムツール呼び出し機能の実装
会話の流れを維持したまま、必要なタイミングで外部ツールを呼び出す機能をサポートしており、LLM がトリガーテキストを生成すると即座に対応する「on-hold」メッセージを発話できる。
自然な対話特性の向上
約 450 ミリの応答遅延を実現し、ユーザーが割り込んで中断する(バージイン)際にも即座に応じるなど、人間同士の会話に近い挙動を示す。
オープンソースとしての公開
研究目的でモデルとコードが GitHub および Hugging Face で公開されており、既存の閉じたフルデュプレックスモデルとの差別化を図っている。
1 つの統合アーキテクチャによるリアルタイムフルデュプレックス
従来のカスケード型スタックではなく、音声理解と生成を同時に実行する単一のモデルで構成されている。これによりエンドツーエンドの遅延が削減され、約 450 ミリの応答速度を実現している。
重要な引用
Unlike traditional cascaded stacks (ASR → LLM → TTS), this model achieves full duplex, real-time, seamless voice interaction in one unified architecture
NVIDIA NemotronLabs VoiceChat is the first open full-duplex model to support tool calling while maintaining a natural conversation flow during tool execution.
This model is ready for research purposes only.
NemotronLabs VoiceChat is the first open full-duplex model to support tool calling while maintaining a natural conversation flow during tool execution
編集コメントを表示
編集コメント
音声 AI の分野において、複雑なパイプラインを単一モデルで統合し、かつツール連携まで可能にした点は画期的である。ただし「研究目的のみ」と明記されているため、実運用への適用には慎重な評価が必要となる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み