Gemini 3.1 Flash TTS:表現豊かな次世代AI音声の登場
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Google AI Blog
Googleは、Gemini 3.1 Flash TTSを全Google製品で提供開始した。この新技術は、感情豊かな自然な音声合成を実現し、ユーザー体験を向上させる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
2026年4月15日
読了時間:10分
最新の音声モデルは、表現豊かな音声生成のためにAIの発話を指示するための精密な制御を可能にする、細分化された音声タグ(audio tags)を導入しました。
V
ヴィロブ・メスラム
シニアプロダクトマネージャー
M
マックス・グビン
ジェミニチーム代表、シニアリサーチエンジニア
概要
Gemini 3.1 Flash TTSが登場し、AI音声の品質と制御性が向上しました。現在、70以上の言語で、音声タグを使用して発話スタイルやペースを調整することができます。Google AI Studio、Vertex AI、および Google Vids でお試しください。すべての音声には SynthID による透かしが埋め込まれており、誤情報防止に貢献しています。
要約は Google AI によって生成されました。生成AIは実験的な技術です。
ポイント
- 「Gemini 3.1 Flash TTS」は、制御性、表現力、品質が向上した新しいAI音声モデルです。
- このモデルは音声品質が改善されており、以前のバージョンよりも自然な響きになります。
- 音声タグ(audio tags)により、自然言語のコマンドを使用して発話スタイル、ペース、および配信方法を制御できます。
- 開発者は Google AI Studio を使用して声を微調整し、一貫した利用のために設定をエクスポートできます。
- Gemini 3.1 Flash TTS は 70以上の言語をサポートし、SynthID透かし(watermarking)を使用して AI生成のオーディオを識別します。
サマリーは Google AI によって生成されました。生成 AI は実験的な技術です。
## 基本的な解説
Gemini 3.1 Flash TTS は、コンピュータの発音をよりリアルに聞こさせる新しい AI です。テキスト内の特殊なコマンドを使用することで、AI の話し方を変更することができます。この AI は 70以上の言語で話すことができ、オーディオに隠し透かし(watermark)を追加します。これにより、これが AI 生成のものであり、実際の人物ではないことを人々が知ることができます。
サマリーは Google AI によって生成されました。生成 AI は実験的な技術です。
image
あなたのブラウザはオーディオ要素をサポートしていません。
記事の再生
このコンテンツは Google AI によって生成されています。生成 AI は実験的な技術です
[[duration]] 分
本日より、Gemini 3.1 Flash TTSを発表いたします。これは、制御性、表現力、品質を向上させた最新のテキスト読み上げ(Text-to-Speech: TTS)モデルであり、開発者、企業、一般ユーザーが次世代のAI音声アプリケーションを構築できるよう支援します。
本日より、3.1 Flash TTSが以下の形で展開されます:
- 開発者向け:Gemini APIおよびGoogle AI Studioを通じてプレビュー版を提供
- 企業向け:Vertex AI上でプレビュー版を提供
- Workspaceユーザー向け:Google Vidsを通じて提供
音声品質と制御性の向上
Gemini 3.1 Flash TTSの全体的な音声品質を改善し、これまでで最も自然で表現豊かなモデルとしました。数千の盲検テストに基づく人間の嗜好を捉えるベンチマークであるArtificial Analysis TTSリーダーボードにおいて、3.1 Flash TTSは印象的なEloスコア1,211を達成しました。
Artificial Analysisはまた、Gemini 3.1 Flash TTSを、高品質な音声生成と低コストの理想的な組み合わせを示す「最も魅力的な四角形」内に位置付けています。このモデルは、ネイティブなマルチスピーカー対話機能、70以上の言語のサポート、自然言語による細かなクリエイティブ制御が可能である点でも際立っています。
より表現豊かな音声生成のための新しいオーディオタグ
3.1 Flash TTS はまた、オーディオタグも導入しています。これは、発話のスタイル、ペース、および伝達方法を制御するための直感的な方法です。自然言語のコマンドをテキスト入力に直接埋め込むことで、より細粒度のレベルで AI による音声出力を制御することができます。
3.1 Flash TTS を利用することで、企業は Vertex AI 内でオーディオタグを活用し、次世代のエンタープライズアプリケーションを強化することができます。
あなたは、開発者体験に関するその他の更新と合わせて、これらのオーディオタグの実験を、開発者に「監督者の椅子」に座るような制御を提供する構成可能なコントロールを持つ Google AI Studio で開始することができます。
- シーン指示:環境を定義し、具体的なセリフの指示を提供することで舞台設定を行います。この世界観の文脈は、キャラクターが「キャラクターらしさ」を保ち、複数回のやり取りを通じて互いに自然に反応することを助けます。
- 話者レベルの specificity:固有の Audio Profile を使用してキャラクターをキャストし、Director’s Notes を指定してペース、トーン、アクセントを切り替えます。インラインタグを使用することで、話者はこれらの高レベル設定から中盤の表現へ切り替えることができます。
- シームレスなエクスポート:パフォーマンスが完成したら、これらの正確なパラメータを Gemini API コードとしてエクスポートでき、さまざまなプロジェクトやプラットフォーム間で一貫性があり認識可能な音声を実現します。
これらの新しい設定により、開発者は特定のシナリオに対する精度を高め、記憶に残るキャラクターや没入感のあるオーディオ体験を作成できます。
グローバルスケール向けに設計
Gemini 3.1 Flash TTS は、70以上の言語で高忠実度の音声とより精密な制御を提供します。これらのコア最適化により、主要市場に対して高度なスタイル、ペース、アクセント制御が可能になり、開発者がグローバルスケールでユーザー向けにローカライズされた表現豊かな音声体験を作成するのを支援します。
初期の開発者およびエンタープライズテスターはすでに 3.1 Flash TTS の影響を目の当たりにしており、その印象的な制御性と表現力を強調しています。彼らは、オーディオタグが創造的な精度の新しいレベルを提供し、単純なテキストを高忠実度のボーカルパフォーマンスに変換することを私たちに語ってくれました。
SynthIDで透かし処理
Gemini 3.1 Flash TTSによって生成されるすべての音声には、SynthIDによる透かし処理が施されています。この不可視の透かしは音声出力に直接織り込まれており、AI生成コンテンツの信頼性の高い検出を可能にし、誤情報防止に貢献します。安全性と責任に関する私たちのアプローチの詳細については、モデルカードをご参照ください。
Googleのストーリーをあなたのメールボックスで受信する。
完了。あと一歩です。
購読を確認するために、あなたのメールボックスをご確認ください。
あなたはすでに私たちのニュースレターに登録されています。
あなたはこの方法でも登録できます
関連ストーリー
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み