豆包、火山エンジン多模態システムでビデオ通話機能強化
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
ByteDance Engineering
ByteDance は豆包の動画通話機能を SeedRealtime モデルと新传输システム MMT を組み合わせて大幅に強化し、全双工通信や環境知能による自然な対話を実現した。
AI深層分析を開く2026年8月20日 21:51
AI深層分析
キーポイント
全双工技術の規模実装
SeedRealtime モデルの導入により、AI が音声・映像・テキストを同時に処理し、ユーザーと AI が同時に話す「全双工」通信を業界で初めて大規模に実現した。
MMT による接続速度向上
火山引擎の多模态传输系统(MMT)は媒体伝送とモデル会話を統合し、従来数秒かかった接続時間を数百ミリ秒に短縮して「秒接通」を実現した。
状態同期による精度向上
メディアストリームとモデルステータスを同一リンクで統制する仕組みにより、情報の欠落や非同期が原因となる答非所問を根本的に防止している。
インテリジェントな伝送制御
伝送層がモデルの要求を理解し、必要に応じて高解像度化や抽帧を行うなど、データ転送を「知能调度」へと進化させた。
豆包视频通话の技術的基盤
豆包のビデオ通話機能は火山エンジンの多様伝送システムによって支えられている。このシステムが通信品質と安定性を向上させている。
重要な引用
AI 可以在连续变化的真实场景中实现更自然的连续交互
建联耗时从秒级压缩到数百毫秒
传输系统第一次“理解”了模型需要什么,而不是机械地搬运所有数据
模型让 AI 更聪明,火山引擎让 AI 更“真实”
編集コメントを表示
編集コメント
豆包の機能強化は、AI が単なるチャットボットから環境と連動する能動的パートナーへと進化していることを示す重要な事例である。伝送技術の革新が AI の実用性を支える基盤となる時代が到来したと言える。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
豆包视频通話機能のアップグレードと、火山エンジンが支える多様伝送システム
2026 年 8 月 20 日 18:00 北京発
見知らぬ観光地で、スマホを掲げて豆包に案内してもらいましょう。路標を見ると自動的に方向を教え、建物を指すとその由来を説明してくれます。周囲の人の会話や屋台の呼び声があっても、豆包はそれらに惑わされず、あなたとの対話に集中します。
豆包のビデオ通話機能がアップグレードされたことで、AI は連続して変化するリアルなシーンでも、より自然な双方向インタラクションを実現しました。これにより、ユーザーには以下の 3 つの大きな変化がもたらされています。
「見ながら、聞きながら、話し続ける」ことが可能になりました。ユーザーは AI の発言が終わるのを待つ必要はありません。AI は音声、映像、テキストという 3 つの入力を同時に受信・処理できます。「この表示板はどうなっているのか」と指差して尋ねれば、それが手荷物回収ベルトを指していることを理解します。複数の人が会話している場合でも、口元や映像の動きから誰が話しているかを判断し、周囲の雑談に巻き込まれることはありません。
AI 側からも積極的に発言するようになりました。環境の変化を常に感知しており、重要な標識を見つけると自ら注意を促します。タスク処理時には必要な情報を検索したり結果を整理したりするために、自らツールを呼び出します。インタラクションのモードは従来の「質問と回答」から、「双方向のコラボレーション」へと進化しました。ユーザーが毎回最初に話しかける必要はありません。
会話のリズムが自然になりました。相手を遮ることもなく、沈黙が続くこともありません。話すべき時に話し、聴くべき時に聴きます。自然なタイミングで会話を引き継ぎ、適切な間を置きます。周囲の雑談と背景ノイズを正確に区別します。
公式の評価によると、従来のカスケード型(級联)ソリューションと比較して、会話のリズムに関する不自然さ(违和问题)が約 50% 減少しました。つまり、「AI が話し終わった後に突然止まってしまう」や「まだ話しているのに AI が先に答え始めてしまう」といった、ユーザーにとっての不快な状況はほとんどなくなりました。
この背景には、2 つのラインでのアップグレードがあります。モデル層では、ネイティブなオーディオ・ビデオ全双工大規模モデルである SeedRealtime が導入され、業界で初めてオーディオ・ビデオ全双工技術のスケールされた実装が実現しました。
そして、これらを支える基盤となる伝送アーキテクチャも、リアルタイム通信(RTC)から火山エンジンの多様伝送システム(MMT)へと、世代を超えた進化を遂げました。
SeedRealtime が「AI ができること」を定義する一方、火山エンジン MMT は「ユーザーがその能力を実感できるか」を決定します。MMT は以下の 3 つの主要な側面で向上を図りました。
一、数秒で接続し、即座に応答
従来の RTC アーキテクチャでは、オーディオ・ビデオチャネルとシグナリングチャネルが分離していました。ユーザーがビデオ通話を開始する際、メディアチャネルの確立、モデルセッションの構築、状態同期など、複数の手順を順次行う必要があり、これらが独立して進行するため、実際に使用可能な状態になるまでに数秒を要することが多々ありました。ユーザーは「接続中…」というローディングアイコンを見せられ、体験が損なわれることになります。
MMT は統一された多様セッションアーキテクチャを通じて、メディア伝送とモデルセッションを深く統合しました。
- クライアント側では QUIC ライブラリを基盤とし、接続の再利用やマルチプレクシングを実現。一度の接続確立で、オーディオ・ビデオ、シグナリング、モデル状態など複数のデータを同時に扱えるようになりました。
- 伝送層では MoQ プロトコルを用いて統一されたセッション制御を実現。メディアストリームと制御シグナルを同一セッション内で協調してスケジューリングできるため、複数のチャネルを個別に確立するオーバーヘッドが不要となりました。
最終的に、接続確立までの時間を秒単位から数百ミリ秒に圧縮しました。ユーザーがビデオ通話を開くと、ほぼ「瞬時に接続」され、会話の連続性が大幅に向上しています。
二、零丢字,从源头杜绝答非所问
従来、音声伝送チャネルとモデル推論チャネルは非同期で接続されていました。つまり、音声が既に転送されているのにモデルのセッションがまだ確立されていない場合や、モデルは準備ができているのに最初のフレームの音声が同期していないといった状況が発生していました。ユーザーが「この問題を解説して」と話し始めると、モデルが受け取るのは「この問題」だけであり、回答が的外れになるのは当然のことでした。
MMT の核心的な突破点は、統一されたマルチモーダル・セッション制御によって、この状態の非同期問題を根本から解決したことです。
- 音声と映像ストリーム、そしてモデルのセッション状態を、同一の伝送リンク内で統合的にスケジューリングします。以前のような「別々のパイプがバラバラに動く」状態ではありません。
- ゲートウェイ層には MediaKit の同源処理アルゴリズムを導入し、リアルタイムで最初のフレームが完全か、音画の同期が取れているか、モデルが準備完了しているかを判断します。すべてのモダリティの状態が同期して初めてモデル推論がトリガーされ、「情報の欠落」や「答非所問(質問と回答の不一致)」を源头上防止しています。
- 遅延の揺らぎが 1 秒を超えると、モデルが受け取る情報が歪んでしまうという従来の課題も、MMT の精密なセッション制御によって体系的に改善されました。
三、精准意图理解,智能推理应答
人間同士の通話であれば、伝送層は忠実にデータを運べばそれで十分です。しかし AI との対話は異なります。ユーザーが画面内の小さな文字を指差して質問した場合、もし伝送層が低ビットレートの映像をそのまま送り続ければ、モデルはその文字を読み取れず、回答も的外れになります。より合理的な方法は、高解像度画像への切り替えやフレーム抽出、あるいは局部の強調処理をトリガーすることです。従来の RTC(リアルタイム通信)には、こうした状況に応じた伝送戦略の調整機能がありませんでした。
MMT は C/S 構造の設計により、伝送を「単なるダストパイプ」から「インテリジェントなスケジューリング層」へと進化させました。
- サービス側のゲートウェイが重要な意思決定を担当します。ユーザーからの発言を受け取った際、ゲートウェイはそれを直接モデルに送るかどうかを選択できます。カメラが開かれた場合も、フレーム抽出が必要か、高解像度画像が必要か、あるいはモデルのフィードバックに基づいて処理戦略を変更すべきかを判断します。
- 階層化されたセッション制御です。どの音声ストリームを優先するか、どのビデオフレームをモデルに送る価値があるか、どのコンテンツを確実に伝送すべきか、どれが低遅延のために犠牲にしてもよいかは、MoQ シグナリング上の階層論理ユニットによって細かく制御されます。
- マルチモーダル同期の保証です。音声、映像、時系列情報は伝送層で既に同期が完了しており、モデルが受け取るのは「パッケージ化され、同期された」マルチモーダル入力です。モデル自身でバラバラのデータを拼凑する必要はありません。
伝送システムは初めて、モデルが何を必要としているかを「理解」するようになりました。MMT は SeedRealtime が受動的にデータを「取りに来る」のを待つのではなく、モデルの推論状態に応じて、「適切なデータ」を「正しい形態」で「適切なタイミング」に能動的に届けるのです。
四、模型决定智能上限,传输决定体验下限
AI のリアルタイム対話における競争は、モデル層だけで起こっているわけではありません。
業界の注目が「どのモデルがより賢いか」という議論に集中している間、火山引擎(Volcengine)はより長期的な取り組みを進めています。すなわち、伝送インフラを「ダストパイプ」から「インテリジェント・スケジューリング層」へと昇華させ、大モデルの能力が端末ユーザーへほぼ無損失で届くようにすることです。
豆包(Doubao)のビデオ通話に SeedRealtime を導入したことは、この能力を包括的に示す一例です。
同時通訳や語学学習、博物館解説などのユースケースが加速して普及するにつれ、「見ながら聞きながら話す」というリアルタイム・マルチモーダル対話は、多くの製品における標準的な体験となるでしょう。その基盤を支えるのは、億単位のユーザーによって検証され、百倍の複雑さを処理できる伝送システムです。
モデルは AI を賢くし、火山引擎は AI を「よりリアル」にします。
WeChat で開くにはこちらへ
原文を表示
视频与边缘 2026-08-20 18:00 北京
image
走到一个陌生景点,举着手机让豆包带你逛,它看到路牌标识主动提醒方向,看到建筑开口介绍典故;旁边路人聊天、街边叫卖,豆包不会被带偏,依然只跟你对话。豆包视频通话功能升级后,AI 可以在连续变化的真实场景中实现更自然的连续交互,这为用户带来了三个最直观的感受:
能边看边听边说。 用户不用等 AI 说完才能开口,AI 能同时接收和处理音频、视频、文本三路输入。指着航班牌问“这个怎么走”,它看懂你指的是行李转盘;多人聊天时,它结合口型和画面判断是谁在对话,不被旁边闲聊带偏。
AI 会主动开口。 持续感知环境变化,看到关键标识会主动提醒,处理任务时主动调用工具查信息、整理结果。交互模式从“一问一答” 升级成了“双向协作”,用户不用每次都先开口。
对话节奏自然。 不打断也不冷场,该说时说,该听时听。自然接话、合理停顿,精准分辨旁人闲聊和背景噪声。官方评测显示,对比传统级联方案,对话节奏违和问题减少了约 50%—— 用户几乎不会遇到“AI 说完话突然停住”或“我还没说完 AI 就抢答”的尴尬。
这背后是一次双线升级:模型层接入原生音视频全双工大模型 SeedRealtime,在业界率先实现音视频全双工技术的规模化落地。而支撑这一切的底层传输架构,也已悄然完成从实时通信技术 (RTC)到火山引擎多模态传输系统(MMT)的代际跃迁。
SeedRealtime 定义了“AI 能做什么”,而火山引擎 MMT 决定了“用户能不能真正感受到这些能力”。MMT 在三个核心环节完成了提升。
一、秒接通,秒应答
传统 RTC 架构下,音视频通道与信令通道分离,用户发起视频通话时需要经历多轮协商 —— 媒体通道建联、模型会话建立、状态同步各自为政,叠加下来往往需要数秒才能真正进入可用状态。用户看到的是“连接中…”的转圈等待,体验大打折扣。
MMT 通过统一的多模态会话架构,将媒体传输与模型会话深度整合:
客户端底层基于 QUIC 库,复用连接、多路复用,一次建联即可承载音视频、信令、模型状态等多路数据;
传输层基于 MoQ 协议实现统一会话控制,媒体流与控制信令在同一会话中协同调度,省去了多通道分别建联的开销。
最终,建联耗时从秒级压缩到数百毫秒,用户点开视频通话几乎“秒接通”,对话感的连贯性大幅提升。
二、零丢字,从源头杜绝答非所问
此前,音频传输通道和模型推理通道是异步建联的 —— 音频可能已经在传了,但模型会话还没建立好;或者模型已经就绪,但首帧音频还没同步到位。用户刚开口说 “帮我看看这道题”,模型只收到了“这道题”,回答自然跑偏。
MMT 的核心突破,就是用统一的多模态会话控制从根本上解决了状态异步问题:
音视频流与模型会话状态在同一传输链路中统一调度,不再是“两条各跑各的管道”;
网关层引入 MediaKit 同源处理算法,实时判断首帧是否完整、音画是否对齐、模型是否就绪——只有所有模态状态同步后,才会触发模型推理,从源头上杜绝了“丢字”和“答非所问”;
延迟抖动超过 1 秒就会导致模型接收信息变形的老问题,在 MMT 的精细会话控制下得到系统性改善。
三、精准意图理解,智能推理应答
人与人通话,传输层忠实搬运就够了。但 AI 交互不一样:用户指着屏幕上一行小字提问,如果传输层继续传低码率视频,模型可能根本看不清那行字,回答自然跑偏,更合理的方式是触发高清图、抽帧或局部增强。传统 RTC 不具备按需调整传输策略的能力。
MMT 通过 C/S 架构设计,让传输从“哑管道”变成了“智能调度层”:
服务侧网关承担关键决策角色。用户传来一句话,网关可以选择是否直接送往模型;用户打开摄像头,网关判断是否需要抽帧、是否需要高清图、是否要结合模型反馈改变处理策略;
分层会话控制。哪一路音频优先、哪一帧视频更值得送给模型、哪些内容需要可靠传输、哪些可以为低延迟做取舍,都由 MoQ 信令上的分层逻辑单元精细控制;
多模态同步保障。语音、画面、时序信息在传输层就完成对齐,模型拿到的是“打包好的、同步的”多模态输入,而不是自己再去拼拼凑凑。
传输系统第一次“理解”了模型需要什么,而不是机械地搬运所有数据。MMT 不是被动地等 SeedRealtime 来 “取”数据,而是主动地根据模型的推理状态,把 “对的数据、以对的形态、在对的时机”递送到模型面前。
四、模型决定智能上限,传输决定体验下限
AI 实时交互的竞争,不只发生在模型层。
当行业焦点都在讨论“谁的模型更聪明”时,火山引擎在做一件更长期的事:把传输基础设施从“哑管道”升级为“智能调度层”,让大模型的能力近乎无损耗地传递给每一个终端用户。
豆包视频通话接入 SeedRealtime,是这套能力的一次完整展示。
随着同传、外语陪练、博物馆讲解等场景加速落地,“边看边听边说”的实时多模态交互将成为越来越多产品的标配体验。而支撑这一切的底座,是一个经过亿级用户验证、能承载百倍复杂度的传输系统。
模型让 AI 更聪明,火山引擎让 AI 更“真实”。
跳转微信打开
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み