Gradium、テキストから数秒で合成音声を作成する「Voice Design」を公開
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
Gradium はテキストプロンプトだけで参照音声なしに合成声を生成する「Voice Design」を API に実装し、業界平均を上回る精度で瞬時に多様な声を実現した。
AI深層分析を開く2026年9月9日 16:30
AI深層分析
キーポイント
プロンプトベースの即時生成技術
Gradium の Voice Design は性別、年齢、アクセントなどの記述のみを入力とし、数秒で完全な合成声を生成する。参照音声や権利処理を必要としないため、既存のカスタムクローンとは異なるアプローチとなる。
API 統合とデプロイの容易さ
この機能は Studio および API で利用可能で、生成された声は既存のカタログ音声と同じストリーミングエンドポイントで同等のレイテンシで動作する。
厳格な評価テストでの優位性
盲聴テストにおいて Gradium は 72.6% の勝率を記録し、13.6 ポイント差で ElevenLabs を引き離して他社製品群を凌駕した。
開発ワークフローと制限事項
候補生成から本番登録までの 4 つの API コールが必要であり、未変換の候補は 30 日後に削除されるなど、一時的な試聴用リソースとして設計されている。
盲聴テストでの圧倒的勝利
6つの音声合成システムと5言語を対象とした7,627件の比較において、Gradiumは72.6%の勝率を記録し、13.6ポイント差で首位に立った。特にケベックフランス語やバイエルンドイツ語などの地域アクセントにおいて、他社を大きく引き離す結果となった。
重要な引用
Voice Design reads a written description and returns complete new voices in a few seconds. No reference audio, no speaker, no rights to clear.
Across 7,627 comparisons, Gradium reports a 72.6% win rate against the field, 13.6 points ahead of ElevenLabs eleven_ttv_v3 at 59.0%
The description is the only input the model gets.
Voice Design turns a 500 character description into up to 5 new voices in seconds, no reference audio required.
編集コメントを表示
編集コメント
テキスト記述のみで高品質な合成声を生成する技術は、コンテンツ制作における声優の確保や権利処理という大きなボトルネックを解消する。特に盲聴テストでの明確な勝率は、このアプローチが単なるギミックではなく実用的な代替手段となり得ることを示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
音声エージェントチームは、いつも同じ壁にぶつかる。カタログには 400 種類の声があるのに、求められるのはその中にない声だ。例えばモントリオールのディーラー向けのケベック訛りの受付嬢や、講堂で説得力を持って話す 60 代のナレーターなどだ。
要望の数はカタログの数を上回る。声を複製(クローン)することでこのギャップを埋めることはできるが、そのたびに調達、同意、ライセンスの問題が生じる。
パリに拠点を置く音声 AI 企業 Gradium は、異なるアプローチでこの課題に答えた。「Voice Design」は、テキストによる記述を読み取るだけで、数秒のうちに完全な新しい声を生成する。参考音源も不要だし、特定の話し手を指定する必要もないし、権利処理の手間もいらない。
実用性はどうか?もちろん可能だ。Voice Design は Gradium の API と Studio で稼働しており、無料プランを含むすべてのプランで無料で利用可能だ。一度作成した声は、カタログ内の既存の声と同じストリーミング TTS エンドポイント上で動作し、レイテンシや出力フォーマットも同等である。
要件定義こそが API となる
記述文だけがモデルへの入力だ。Gradium のドキュメントによると、モデルが応答する属性は以下のようなもので、まるでキャスティングの募集要項のようだ:性別、年齢層、アクセントまたは出身地、ピッチ、ペース、エネルギー、音色と共鳴、レジスター(声域)や話し方、そしてその声が担う役割だ。
記述文は英語、フランス語、スペイン語、ポルトガル語、ドイツ語のいずれかで 1〜500 文字程度で入力する。Gradium は、音声の色だけでなく、その声の使い道やレジスターを決定づけるため、記述の最後には「用途」を明記することを推奨している。
1 回のリクエストで、通常 3〜5 秒以内に 1 から 5 つの候補が返されます。これらは同一キャラクターのバリエーションであり、異なるキャラクターを指定すれば別の説明が生成され、サンプル数が増えるわけではありません。
候補から本番環境への移行までのフローは、4 つの呼び出しで構成されています。まず POST /voice-generator/generate で候補 ID を発行し、状態を ready: false に設定します。次に GET /voice-generator/embeddings をポーリングして、ステータスが切り替わるまで待ちます。その後、各候補は通常の TTS エンドポイントを経由してオーディションされ、ここで候補 ID が voice_id として使用されます。最後に、採用した候補を本番用ボイスに昇格させるために POST /voices/from-embedding を実行します。
未変換の候補には、変換済みボイスにはない 3 つの制限が適用されます。オーディション用のテキストは最大 100 文字までと制限されており、REST API のみに対応しています。また、TTS WebSocket や音声入力(Speech-to-Speech)では使用できません。未変換の候補は 30 日後に自動的に削除されます。変換は無料で、有効期限も解除され、クローンと共有されるカスタムボイスの枠を 1 つ消費します。無料プランでは最大 5 個、有料プランでは最大 1,000 個まで利用可能です。
サンプリングは意図的に非決定論的に行われています。Gradium チームがまずプロンプトの説明を拡張し、その拡張結果はリクエストごとに異なるため、同じプロンプトと固定シードを使用しても、毎回異なる声が生成されます。
ベンチマークの読み方
Gradium は、公開 API で利用可能な 6 つの音声設計システムと 5 カ国語を対象に、アクセントプロンプトに関する盲検ペア比較テストを実施しました。ネイティブスピーカーはラベルのない 2 クリップを聴き、より近いものを選択するか、同点とするかを選びました。7,627 回の比較全体で、Gradium は 72.6% の勝率を記録し、13.6 ポイント差をつけて ElevenLabs の eleven_ttv_v3(59.0%)を首位に立ちました。続くのは Inworld(44.8%)、Fish Audio(36.7%)、MiniMax(31.7%)です。勝率は「勝利数+同点数の半分」で計算され、50% が平均値となります。Gradium は 5 カ国すべてで 1 位を獲得しました。特に多くのカタログが平坦化してしまう地域アクセントでの差は顕著でした。ケベックフランス語では 97%、リオプラテンセスペイン語では 86%、バイエルンドイツ語では 85%、コロンビアスペイン語とアフリカポルトガル語ではそれぞれ 83% の勝率を記録しています。
同じプロンプトセットに対するモデルによる評価でも結果は一致しました。Gemini 3.1 Pro がラベルのない単一クリップを 1 から 5 で評価したところ、順位は Gradium 4.06、ElevenLabs 3.86、Inworld 3.64、Fish Audio 3.51 となり、Gradium の首位が確認されました。また製品ページでは、TTS における指示従順性を評価する学術ベンチマーク「InstructTTSEval」の英語スプリットにおいて、プロンプト遵守率が 83.4% に達すると主張しています。(注:これらの数値はすべてベンダー自身が設計・実施したものです。)
主なポイント
- Voice Design は、500 文字以内の説明から参照音声なしで数秒以内に最大 5 つの新しい声を生成します。
- この機能は API と Studio の両方で利用可能であり、すべての Gradium プラン(無料プラン含む)で、5 カ国語に対応してすぐに使用できます。
- ベンダーが実施した盲検テストでは、7,627 回の比較を通じて 72.6% の勝率を記録し、5 カ国すべてで 1 位となりました。
作成した声は、REST や WebSocket、音声対音声機能において通常の voice_id として利用可能です。
サンプリングは非確定的なため、保存されていない候補データは 30 日経過すると完全に削除されます。
※本記事は MarkTechPost にて最初に公開されました。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み