MarkTechPostメディア報道·2026年8月10日 08:58·約6分
NVIDIA、全二重音声対話モデル「VoiceChat 11B」を公開
本文の状態
日本語全文あり
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
30秒でわかる
NVIDIA はフルデュプレックス対応のオープン音声対話モデル「NemotronLabs VoiceChat 11B」を公開し、450 ミリ秒以下のターンテイクと通話中のツール呼び出し機能を備えた。
記事の3ポイント
ユニファイドアーキテクチャによる低遅延化
ASR、LLM、TTS を別々に連結する従来の方式ではなく、単一のネットワークで音声理解と生成を同時に行うことで、エンドツーエンドの遅延を 448 ミリ秒に削減した。
通話中の割り込みとツール呼び出し機能
ユーザーが会話中に割り込めるフルデュプレックス機能を備えつつ、別出力チャネルを用いて通話の継続中にもリアルタイムでツール呼び出しを実行可能にした。
実用化に向けた制限と課題
研究目的専用として公開されており、2 分間の音声コンテキスト制限や複数ターン後の劣化など、実運用にはまだ解決すべき失敗モードが存在すると明記されている。
なぜ重要か・誰に関係するか
この発表の重要性は、従来のカスケード型アーキテクチャに依存せず、単一ネットワークで低遅延かつ通話中のツール呼び出しを可能にする技術的転換点にあることだ。開発者や企業の AI 導入担当者は、研究目的専用という制限を理解した上で、接触センターや自動運転車内アシスタントなどの実装において、このモデルが持つ潜在的な応用可能性と現在の技術的課題を評価する必要がある。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るこの記事をシェア
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み