通義実験室、Qwen-Audio-3.0-TTS を発表しリアルタイム性と自然度を向上
本文の状態
日本語全文を表示中
詳細モードで約8分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Tongyi Lab
通義实验室は2026年7月、多言語・方言対応と高品質な表現制御を強化したリアルタイム音声合成モデル「Qwen-Audio-3.0-TTS」を発表し、人工知能分析のグローバルランキングでPlus版が首位を獲得した。
AI深層分析を開く2026年8月1日 01:52
AI深層分析
キーポイント
双バージョン戦略の実現
Flash版は300msの低遅延を特徴としリアルタイム交互に最適化され、Plus版は自然度と音色再現性を追求して高品質生成向けに設計された。
多言語・方言カバーの拡大
16か国語および中国国内の20種方言を支援し、WER/CER指標で他システムを上回る可読性と高い話者類似性を達成した。
開発課題への対応強化
広範な言語カバレッジ、自然な指令制御、細かなタグ操作、不鮮明な参考音声での頑健性という4つの実務上の課題に焦点を当てた。
権威ある評価で首位獲得
第三者機関であるArtificial Analysisのグローバルランキングにおいて、Qwen-Audio-3.0-TTS-Plusが音声合成分野で1位を獲得したと発表した。
自然言語による自由な音声演出
専門知識が不要で、自然言語指令を用いて情緒や役割、語速などを柔軟に定義し、期待通りの合成結果を得られる。
重要な引用
让语音合成从"能说话"进化到"会表达"
Flash:面向实时交互,首包延迟在 300ms 左右
Qwen-Audio-3.0-TTS-Plus 斩获冠军
无需掌握专业声学或标注知识,即可通过自然语言灵活定义情绪、角色、场景、语速等维度
編集コメントを表示
編集コメント
通義实验室は音声合成の性能指標において明確な優位性を示したが、方言対応の詳細な実装状況や、不鮮明音声に対する具体的なアルゴリズム改良内容は今後の検証課題となる。開発者は自社のユースケースに合わせて、低遅延を重視するFlash版と高品質を重視するPlus版の使い分けを検討すべきである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
「ただ話せる」から「感情を込めて話せる」へ:Qwen-Audio-3.0-TTS の登場
通義实验室 2026年7月20日 16:54 浙江
音声合成技術が「単に音声を出力する」段階から、「感情やニュアンスを表現できる」段階へと進化しました。
Qwen-Audio-3.0-TTS というリアルタイム音声合成モデルが発表されました。今回は 2 つのバージョンを用意しています。
Flash:リアルタイムな対話に適したモデルで、最初の音声が出力されるまでの遅延は約 300ms です。
Plus:高品質な生成を目的としたモデルで、自然さや音色の再現性において優れたパフォーマンスを発揮します。
今回のアップデートでは、開発者が実際の運用環境で直面する 4 つの課題に焦点を当てました。それは、対応言語のカバー範囲拡大、より直感的な指示制御、細かなトーンや感情のタグによる制御、そして参照音声の品質が低い場合でも安定して動作する堅牢性です。
現在、世界の第三者機関である Artificial Analysis の公式ランキングにおいて、Qwen-Audio-3.0-TTS-Plus が 1 位を獲得しました!
以下に、具体的な更新内容と数値データの詳細を解説します。
能力の全体像
詳細に入る前に、Qwen-Audio-3.0-TTS の主要な能力マトリックスを簡単に確認しておきましょう。
「ただ話せる」から「表現力豊かに話す」へ:Qwen-Audio-3.0-TTS の登場
核心亮点一:多语种と方言の大幅な進化
海外展開やローカル市場への対応において、Qwen-Audio-3.0-TTS は現地の文脈に完璧に溶け込むような聴覚体験を提供します。
多言語合成の精度向上で指標をリード
Qwen-Audio-3.0-TTS はグローバルな多言語シーン向けに特別に最適化され、中国語、英語、日本語、韓国語、ドイツ語など 16 か国語に対応しています。
🟣 WER/CER(数値が低いほど優秀)
Qwen-Audio-3.0-TTS シリーズは、全体としての多言語可読性において最強の性能を示しました。対象とした 16 か国語のうち 10 か国で、WER/CER のベストスコアを記録しています。Flash バージョンの平均 WER/CER は驚異的な 3.87 で、Plus バージョンも 3.96 と非常に高い競争力を持っています。両バージョンとも、他のシステムとの比較において平均性能で上回っています。
※評価は CV3-Eval の多言語ベンチマークに基づくものです。
🟣 話者類似度(数値が高いほど優秀)
Qwen-Audio-3.0-TTS は、話者の声質の類似性において顕著かつ安定した優位性を示しています。特に Plus バージョンは全 16 か国語で 1 位を獲得し、平均 SS(Speaker Similarity)は 82.75 に達しました。Flash バージョンも 80.44 とそれに次ぐ結果です。これは、多言語環境下においても極めて強力な音色の再現能力とロバスト性を備えていることを意味しています。
※評価は CV3-Eval の多言語ベンチマークに基づくものです。
中国語の方言表現が本格的に強化
より高品質な方言データと、カバーする種類の拡大、そして専用の方言強化トレーニング段階を導入したことで、Qwen-Audio-3.0-TTS モデルは、従来の汎用音声強化学習で起こりがちだった「方言らしさの希薄化」という課題を効果的に解決しました。
現在、モデルは20種類の方言に対応しており、これらは広東語、重慶方言、東北弁、甘粛方言、貴州方言、浙江方言、河北方言、河南方言、湖北方言、湖南方言、江西語、寧波語、寧夏方言、青島方言、陝西方言、山西語、山東話、上海語、四川語、雲南語をカバーしています。これにより、合成音声の韻律や声調、そして口語的な表現が母語話者に近づき、各地域特有の言語の真髄を再現します。
核心亮点二:Free-style 自由指令,用自然语言“导演”声音
異なるシーンでは、音声スタイルに対するニーズが大きく異なります。カスタマーサポートでは温和で忍耐強いトーンが求められ、ライブ配信では情熱的で感染する力が重要であり、オーディオブックではキャラクターへの没入感が不可欠です。
Qwen-Audio-3.0-TTS は、Free-style(自由形式)の自然言語指令による制御をサポートしています。専門的な音響知識や注釈付けのスキルは不要で、自然言語を使って感情、役割、シーン、話速などの要素を柔軟に定義できます。これにより、合成結果が期待通りになる確率が格段に高まります。
核心亮点三:细粒度标签控制,精确到呼吸和情绪
自由なテキスト指令に加え、モデルはテキスト内に構造化タグ(例:[gasp]、[giggles]、[angry])を直接埋め込むことも可能です。これにより、トーンや感情、そして「breath(息継ぎ)」のような微細なディテールまで精密に制御できます。
この手法は、非言語的な要素を厳密にコントロールする必要があるナラティブ(物語)、ゲーム、映画・ドラマの吹き替えなどのシーンで特に有効です。タグと音声は自然に融合し、柔軟に組み合わせることで複雑な感情表現を構築することが可能です。
核心亮点四:复杂声学鲁棒性,无惧嘈杂环境的音色复刻
実際の業務において、参照となる音声データは複雑な環境から得られることがよくあります。Qwen-Audio-3.0-TTS はこれに対応するため、実在する音響環境をシミュレーションしたトレーニングを専門に行い、音声強化機能をリプレイス(音色再現)プロセスにネイティブに組み込みました。
モデルは、雑音の多い環境でも自動的に「干渉を除去し、音色を保持」します。これにより、複雑なシーンにおける再現の明瞭度と知覚品質が大幅に向上しました。参照条件が劣っていても、合成音声は高品質を維持します。
- 高混響场景:残響による干渉を効果的に抑制し、合成音声をよりクリーンでクリアにします。
- 高噪声场景:ノイズ耐性が強化され、前世代と比較して音声品質が著しく向上しています。
Also in this release:精品音色库
Qwen-Audio-3.0-TTS に付属するプレミアムボイスライブラリは、モデルが多言語・多方言対応、指令制御、細粒度表現で持つ能力を、すぐに使える音声リソースとして凝縮したものです。ライブラリには、指令スタイルのボイス、20種類の方言ボイス、細粒度制御用ボイス、そして14以上の小语种(少数民族語や地域限定言語など)ボイスが含まれており、ビジネス側がさまざまなシーン向けの音声ソリューションを迅速に立ち上げるのを支援します。
真面目な創作シーンにおいては、オーディオ出力の品質を24kHzから48kHzへと引き上げました。また、1回の音声合成で最大3分間の長文もサポートしており、長時間のテキスト読み上げニーズにも容易に対応できます。
(注:一部の方言や小语种のプレミアムボイス、および48kHz高解像度オーディオ出力機能は、現在アリババクラウドの百炼プラットフォームで順次公開されています。48kHz機能は7月24日の正式開放を予定しており、詳細はコンソールの実際の表示をご確認ください。)
核心亮点
- 自然言語でキャラクター、感情、シーン、トーンを直接記述可能。合成結果は指令に応じて変化します。
- コンテキストに応じたトーン選択をサポート。同じ文章でも、異なるシーンでは異なる感情を表現できます。
- ささやき、笑い声、感情の転換など、細粒度な表現に対応。よりリアルな話し方に近づきます。
- 長文においても、リズム、明瞭度、音色の一貫性を維持します。
- ラジオパーソナリティ、カウンセリング、SF AI など、多様なキャラクター表現をカバーしています。
Qwen-Audio-3.0-TTS は現在、全面的に利用可能です。
「単に話せる」から「表現力豊かに話す」へ。技術の境界は着実に広がっています。
開発者の皆様、ぜひご体験ください。音声合成の可能性を共に探求していきましょう。実装や運用においてご意見・ご感想がございましたら、技術コミュニティでのご議論をお待ちしています。
Qwen-Audio-3.0-TTS-Plus の詳細:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china
Qwen-Audio-3.0-TTS-Flash の詳細:
https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china
公式ブログ:
https://funaudiollm.github.io/qwen-audio-3.0-tts/
関連記事・おすすめコンテンツ
原文を表示
原创 通义实验室 2026-07-20 16:54 浙江
image
让语音合成从"能说话"进化到"会表达"
Qwen-Audio-3.0-TTS 实时语音合成模型发布。本次发布包含两个版本:
Flash:面向实时交互,首包延迟在 300ms 左右。
Plus:面向高质量生成,在自然度和音色还原度上表现更佳。
本次更新,我们把精力放在了开发者在生产环境中真正会遇到的四个问题上:更广的语言覆盖、更自然的指令控制、更精细的标签控制,以及在参考音频不清晰时的鲁棒性。
目前,在全球第三方权威榜单 Artificial Analysis 中,Qwen-Audio-3.0-TTS-Plus 斩获冠军!
以下是具体的更新内容与数据表现。
能力总览
在展开细节之前,先快速看一下 Qwen-Audio-3.0-TTS 的核心能力矩阵:
核心亮点一:多语种与方言全面升级
无论是出海业务还是下沉市场,Qwen-Audio-3.0-TTS都能提供完美融入当地语境的听觉体验。
多语种精准合成,指标全面领先
Qwen-Audio-3.0-TTS 面向全球多语种场景进行了专项优化,覆盖中文、英文、日语、韩语、德语等16 种语言。
🟣 WER/CER(越低越好)
Qwen-Audio-3.0-TTS 系列展现了最强的整体多语言可懂度,在 16 种语言中有 10 种取得了最佳的 WER/CER 表现。Flash 版本的平均 WER/CER 最低,仅为 3.87;Plus 版本也极具竞争力,得分为 3.96。两者在平均表现上均优于其他系统。
评测基于CV3-Eval的multilingual benchmark
🟣 说话人相似度(越高越好)
Qwen-Audio-3.0-TTS 在说话人相似度上展现出了显著且稳定的优势。其中 Plus 版本在所有 16 种语言中均排名第一,平均 SS(Speaker Similarity)达到了 82.75;Flash 版本紧随其后,得分为 80.44。这表明它们在多种语言环境下,都具备极强且鲁棒的音色还原能力。
评测基于CV3-Eval的multilingual benchmark
中文方言正宗度显著提升
通过更高质量的方言数据、更丰富的种类覆盖,以及专门的方言强化训练阶段,Qwen-Audio-3.0-TTS 模型有效缓解了通用语音强化学习中容易出现的“方言特色弱化”问题。
目前模型支持20 种高质量方言(覆盖广东、重庆、东北、甘肃、贵州、浙江、河北、河南、湖北、湖南、江西、宁波、宁夏、青岛、陕西、山西、山东、上海、四川、云南),使合成语音在韵律、声调和口语化表达上更接近母语者,还原各地语言的真实韵味。
核心亮点二:Free-style 自由指令,用自然语言“导演”声音
不同场景对语音风格的需求差异很大——客服需要温和耐心,直播需要热情感染,有声书需要角色代入。
Qwen-Audio-3.0-TTS 支持Free-style 自然语言指令控制。无需掌握专业声学或标注知识,即可通过自然语言灵活定义情绪、角色、场景、语速等维度,让合成结果与预期高度一致。
核心亮点三:细粒度标签控制,精确到呼吸和情绪
除了自由文本指令,模型还支持在文本中直接嵌入结构化标签(如 [gasp]、[giggles]、[angry]),直接对语气、情绪和 breath 类细节进行精准调控。
这种方式特别适合需要精确控制非语言细节的叙事、游戏、影视配音等场景,标签与语音自然融合,可灵活组合构建复杂情感表达。
核心亮点四:复杂声学鲁棒性,无惧嘈杂环境的音色复刻
真实业务中,参考音频往往来自复杂环境。Qwen-Audio-3.0-TTS 对此做了专项优化,通过针对性的真实声学仿真训练,将语音增强能力原生注入复刻流程。
模型能够在嘈杂环境中自动“过滤干扰、保留音色”,复杂场景下的复刻清晰度和感知质量显著提升。即使参考条件不佳,合成语音依然保持高质量。
高混响场景:有效抑制混响干扰,合成更干净清晰。
高噪声场景:抗噪能力更强,语音质量显著优于前代。
Also in this release:精品音色库
Qwen-Audio-3.0-TTS 配套的精品音色库,将模型在多语种、多方言、指令控制和细粒度表达上的能力沉淀为开箱即用的音色资源。音色库覆盖指令风格音色、20 种方言音色、细粒度控制音色以及 14+ 款小语种音色,帮助业务方快速上线不同场景的声音方案。
面向严肃创作场景,我们将音频输出品质从 24kHz 跃升至 48K。同时,单次语音合成支持长达 3 分钟,轻松满足长文本播报需求。
(注:部分方言、小语种精品音色及 48K 高清音频输出功能目前在阿里云百炼平台正陆续上线中,其中 48K 功能预计于 7月24日 正式开放,具体请以控制台实际展示为准。)
核心亮点
可直接用自然语言描述角色、情绪、场景和语气,合成结果会随指令变化。
支持上下文驱动的语气选择,同一句文本在不同场景下可以读出不同情绪。
支持耳语、笑场、情绪转折等细粒度表达,声音更接近真实说话。
长文本中能保持节奏、清晰度和音色一致性。
角色化表达覆盖电台主持、心理咨询、科幻 AI 等场景。
Qwen-Audio-3.0-TTS 现已全面开放。
从“能说话”到“会表达”,技术的边界正在被不断拓宽。我们诚邀广大开发者接入体验,共同探索语音合成的更多可能性。如果您在应用落地中有任何反馈或建议,欢迎通过技术交流群与我们探讨。
Qwen-Audio-3.0-TTS-Plus:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china
Qwen-Audio-3.0-TTS-Flash:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china
Blog:https://funaudiollm.github.io/qwen-audio-3.0-tts/
推荐内容
跳转微信打开
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み