ボクストラの発表
本文の状態
日本語全文を表示中
詳細モードで約9分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Mistral AI
Voxtralは、9言語に対応した軽量4Bパラメータのテキスト読み上げモデル「Voxtral TTS」をリリースした。このモデルは感情表現が豊かで、大規模なエージェント運用において自然で信頼性が高く、コスト効率が高いとされている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
本日、私たちは最先端の多言語音声生成性能を備えた最初のテキスト読み上げモデル「Voxtral TTS」を発表します。このモデルは 4B パラメータという軽量設計であり、Voxtral を搭載したエージェントは、大規模展開においても自然で信頼性が高く、コスト効率に優れたものとなります。
ハイライト。
- 9 つの主要言語でリアルかつ感情豊かな発話を実現し、多様な方言にも対応しています。
- 最初の音声出力までの遅延時間が極めて短い。
- 新しい声への適応が容易です。
- Mistral Studio でテスト利用可能です。
- エンタープライズグレードのテキスト読み上げ技術により、重要な音声エージェントワークフローを駆動します。
自然な音声生成には、モデルがテキストを単に朗読するだけでなく、正確に解釈する能力が不可欠です。文脈理解(例えば、無表情、喜び、皮肉など)が、聴衆にとってその生成物が自然なものなのか機械的なものなのかを決定づけます。私たちのモデルは、文脈理解と話者モデリングの両面で卓越しており、特定の人物がどのように自然に話すかを捉えます。当社の音声適応技術は、従来の朗読型アプローチを超え、話者の個性、すなわち自然な間、リズム、イントネーション、そして感情表現の巧みさまでを捉えるものです。コンパクトなサイズ、低コスト、低遅延、そして容易な適応性を備えた Voxtral TTS は、自社の音声 AI スタックを完全に制御・カスタマイズしたい企業にとって、そのための完全なコントロールと柔軟性をもたらします。
オーディオは新たな UX です。会話や理解において音声にしか存在しない新しい相互作用を生み出しましょう。米語、英式英語、フランス語の方言に対応する「Mistral Voices」で AI Studio での利用を今すぐ開始してください。
聞いて判断してください:違いを識別できますか?
私たちのチームは複数の方言を含む数十の言語を話し、文化的なニュアンスの重要性を理解しています。私たちは自分たちを反映したモデルを構築しました。音声生成は、自然なリズム、感情、さらにはユーモアの活用を通じて信頼性を築きます。そのため、音声エミュレーションにおいては、真正性と感情的な表現力に焦点を当てました。
最先端のパフォーマンス
単語誤り率や多言語テキスト読み上げシステムの音声品質スコアといった自動評価指標では、音声の自然さを測定することはできません。何が音声を自然にするのかは極めて微妙で、文化的差異や典型的な発話パターンに対する深い理解を必要とします。そのため、ネイティブスピーカーによる比較的人間評価が不可欠です。
音声エージェントにおいては、レイテンシ(応答遅延)と品質は常に緊張関係にあります。人間評価によると、Voxtral TTS は ElevenLabs Flash v2.5 と比較して同等の Time-to-First-Audio (TTFA) を維持しながら、 superior な自然さを達成しています。また、Voxtral は ElevenLabs v3 の品質と同等のパフォーマンスを発揮し、より生々しい対話を実現するための感情制御(emotion-steering)を成功裏にサポートしています。

Voxtral TTS と ElevenLabs v2.5 Flash のゼロショットカスタム音声コンテキストにおける比較人的評価を実施しました。9 つのサポート言語それぞれについて、それぞれの母語方言で認識可能な 2 つの声を用い、3 人の注釈者が自然さ、アクセントへの準拠度、および元の参照音源との音響的類似性の観点からペアごとの並列選好テストを行いました。このゼロショット多言語カスタム音声設定において、Voxtral TTS は v2.5 Flash との品質格差を拡大し、あらゆる声に対する Voxtral TTS の即時カスタマイズ性を浮き彫りにしています。
母語で話されるように。
大規模な音声データセットでトレーニングされた Voxtral TTS は、グローバルアプリケーション向けに構築されています。英語、フランス語、ドイツ語、スペイン語、オランダ語、ポルトガル語、イタリア語、ヒンディー語、アラビア語の 9 か国語において最先端のパフォーマンスをサポートします。
このモデルは、3 秒というわずかな参照音声でカスタム音声に適応し、単に声質だけでなく、参照音源で表現されるような微妙なアクセント、イントネーション、抑揚、さらには不自然さ(disfluencies)といったニュアンスも捉えるようにトレーニングされています。API ではいくつかのプリセット音声オプションを提供していますが、社内音声ライブラリへの拡張は簡単です。使用ケースに合わせてカスタマイズし、言語やアクセントにローカライズし、中立的またはより感情的な表現、カジュアルまたはフォーマルなトーン、自然で会話的なものからロボットのようなものまで、自由に調整可能です。
このモデルは、明示的にそのために訓練されていないにもかかわらず、ゼロショットの異言語音声適応も示します。例えば、このモデルはフランス語の音声プロンプトと英語テキストを用いて英語の発話を生成できます。結果として得られる発話は自然に聞こえつつ、提供された音声プロンプトのアクセント(本例では、自然なフランス語訛りの英語)を採用しています。これにより、カスケード型の音声対音声翻訳システムの構築においてこのモデルは有用となります。
カスケード型音声対音声翻訳
スピーカーをプロンプトブロックにクリックして接続するか、接続することで、音声からテキストへの翻訳機能を有効化できます。
低遅延ストリーミング向けに設計
遅延は音声エージェントアプリケーションにおいて極めて重要です。Voxtral TTS は、10 秒・500 文字の典型的な入力音声サンプルに対してモデル遅延 70ms を達成し、リアルタイムファクター (RTF: Real-Time Factor) は約 9.7 倍です。このモデルはネイティブで最大 2 分間のオーディオを生成可能であり、当社の API はスマートなインターリーブ処理により任意の長さの生成に対応しています。
Voxtral TTS アーキテクチャ
本モデルは、Ministral 3B を基盤とした、トランスフォーマーベースの自己回帰型フローマッチングモデルです。以下のコンポーネントで構成されています:
- 3.4B パラメータを持つトランスフォーマーデコーダーバックボーン
- 390M のフローマッチング音響トランスフォーマー
- 300M のニューラルオーディオコーデック(対称型エンコーダー・デコーダ)
このモデルは、5〜25 秒の音声プロンプトと、9 言語に対応したテキストプロンプトを受け取ります。各オーディオフレームに対して、トランスフォーマーバックボーンが意味トークンを予測し、その後フローマッチングトランスフォーマーが 16 回の関数評価(NFEs)を実行して音響潜在変数を生成します。
私たちは社内開発のコーデックを開発しました。これは、意味 VQ(語彙数 8192)と音響 FSQ(36 次元、21 レベル)の潜在変数を用いてオーディオを因果的に処理し、12.5Hz のフレームレートで出力します。

エンタープライズ向け音声ワークフローを推進する。
**
**Voxtral TTS はオーディオインテリジェンスのループを完結させ、エンタープライズの音声パイプラインに人間によるテストに合格する出力層を提供します。これは Voxtral Transcribe と併用して完全な音声対音声を実現するか、またはクロスリンガルサポートを備えた既存の音声テキスト変換および LLM スタックへ統合されます。
ワークフロー
カスタマーサポート
自然でブランドに合った音声を用いて、複数のチャネル間で問い合わせをルーティングし解決する音声エージェント。
既存のカスタマーサポート通話システムに Voxtral TTS を組み込み、自動化された音声応答を実現します。出力は既存のワークフローへ統合可能です。
Mistral Studio でモデルを試す
Voxtral TTS を Mistral Studio プレイグラウンド で直接実験できます。Mistral の音声から一つを選択するか、ご自身の音声を録音してください。
Voxtral TTS の利用開始
Voxtral TTS は現在、API を通じて利用可能で、料金は 1,000 文字あたり 0.016 ドルです。
Mistral Studio または Le Chat で今すぐお試しください。
複数のリファレンス音声を持つモデルは、CC BY NC 4.0 ライセンスの下でオープンウェイトとしてHugging Face で利用可能です。
モデルのドキュメントをご覧ください。または、当社の研究論文をお読みください。
詳細については、今後のウェビナーにご登録ください!
採用情報
私たちは AI の音声層を構築しています。もしあなたがこのような課題に取り組みたいとお考えであれば、ご連絡をお待ちしています。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み