Meta、リアルタイム音声認識モデル「Muse Voice Transcribe」を発表し他社を凌駕
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The New Stack AI
Meta はリアルタイム音声認識モデル「Muse Voice Transcribe」を発表し、英語ベンチマークで競合他社を上回る精度を達成した。
AI深層分析を開く2026年9月2日 03:16
AI深層分析
キーポイント
競合他社との性能比較
Artificial Analysis のベンチマークにおいて、Muse Voice Transcribe は英語認識の単語誤り率(WER)が 3.1% で、Cartesia や ElevenLabs などの主要競合を上回った。
高度な多言語・多話者対応
同モデルは 70 か国以上の言語に対応し、25 言語を厳密に検証済みで、会話中の言語切り替えや 1 時間を超える長文の認識も可能である。
適応的遅延(Adaptive Delay)技術
モデルが音声入力ごとにテキスト出力か次回の音声入力を判断する仕組みにより、難易度に応じて処理遅延を最適化し、リアルタイム性を向上させている。
提供形態と価格設定
Meta Model API や Mac 版 Meta AI などで利用可能となり、1,000 音声分あたり 3 ドルという比較的手頃な価格で提供されるが、オープンウェイトは公開されない。
競合他社との市場状況
OpenAI、Google、xAI、Alibaba が数週間でストリーミングモデルを相次いでリリースしており、0.3ポイントのベンチマーク差は競争が激しい中で長く維持されない。
重要な引用
at least on some benchmarks, outperforms virtually every other comparable model when it comes to working with speech in real time
the model controls how much audio it hears before committing to a word, it also controls its own latency. Meta calls this 'adaptive delay'
a word error rate reward and a delay reward are multiplied together rather than added
"Real-time transcription has quietly become one of the most crowded corners of the AI market this summer..."
編集コメントを表示
編集コメント
Meta が発表したこのモデルは、リアルタイム処理における「遅延」と「精度」のトレードオフを解決する新たなアプローチを示している。特に多言語対応と適応的遅延技術は、グローバルな音声アプリケーション開発において重要な指針となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

Meta のスーパーインテリジェンス・ラボは火曜日、リアルタイム音声認識モデル「Muse Voice Transcribe」を公開しました。このモデルは少なくともいくつかのベンチマークにおいて、リアルタイムでの音声処理能力において他社と比較可能なほぼすべてのモデルを上回る性能を示しています。
同ラボはこのモデルを、初の「リアルタイム音声知覚モデル」と位置付けています。また、同社は最近「Muse Spark」もリリースしており、こちらは音声からテキストへの変換機能を備えていますが、今回のようなリアルタイム特化型ではありません。
Meta によると、このモデルは 20 人以上の話し手を識別可能で、70 以上の言語でトレーニングされています。そのうち 25 言語については「徹底的に検証済み」です。会話中に複数の言語を切り替えるマルチリンガル対応もサポートしており、1 時間を超える長尺な会話にも対応可能です。
imageCredit: Meta.
現在は、Meta Model API や Mac 版の Meta AI、そして Muse Code を通じて利用可能です。API の料金は 1,000 オーディオ分あたり 3 ドル(時間換算で 0.18 ドル)と、比較的リーズナブルです。
Muse Glimmer モデルとは異なり、このモデルのオープンウェイトは公開されません。Meta の広報担当者が The New Stack にそう明言しました。
Benchmark lead, in English
Artificial Analysis が公開した「AA-WER ストリーミング音声認識精度ベンチマーク」において、Muse Voice Transcribe の単語誤り率(WER)は 3.1% を記録し、主要競合他社をリードしています。比較対象となったのは、Cartesia の Ink-2(3.4%)、ElevenLabs の Scribe v2 Realtime(3.6%)、GPT Live Transcribe(3.9%)、そして Gemini 3.5 Transcribe Live(4%)などです。なお、このベンチマークは英語音声に限定された評価であることを付記しておきます。
話者識別の精度については、どのモデルもユーザーが求める水準にはまだ届いておらず、課題が残っています。しかし、今回のリアルタイム利用ケースに限れば、Muse Voice Transcribe は標準的なベンチマーク群全体で 17.5% の誤り率を記録し、他社をリードする結果となりました。
Credit: Meta.
仕組みの解説
Meta によると、Muse Voice Transcribe は「Muse Spark」ファミリーに属する自己回帰型マルチモーダルモデルです。このモデルが特に興味深いのは、発言のタイミングをどのように判断しているかという点にあります。
入力される音声は 80 ミリ秒ずつ(1 秒間に 12.5 チャンク)の断片として処理され、それぞれが単一の「ソフトトークン」に圧縮されます。各チャンクごとにモデルは判断を下し、テキストトークンを出力するか、あるいは次の音声チャンクを待機するための特殊なプレースホルダー("next audio")を発行します。システムはこのプレースホルダーを検知すると、実際の次の音声チャンクと差し替えます。
入力が停止すると、「空の音声」を示すトークンがモデルに伝わり、それ以上入力がないことを認識して、蓄積中のテキストを出力します。
このように、どの単語を出力するかを決める前にどれだけの音声を聴くかをモデル自身が制御できるため、遅延(レイテンシ)も最適化されます。Meta はこれを「適応型遅延(adaptive delay)」と呼んでいます。難しい単語にはより多くの文脈情報を提供し、簡単な単語はほぼ即座に書き起こすという仕組みです。
このトレードオフは、モデルの強化学習フェーズ内で学習されます。ここでは単語誤り率に対する報酬と遅延に対する報酬が足し算されるのではなく、掛け合わされて計算されます。
このシステムは、話者検出においても同様のメカニズムを採用しています。
今夏、リアルタイム文字起こしの分野は、AI 市場の中で最も過熱した一角の一つとなりました。すでに専門家がいた領域に、OpenAI、Google、xAI、Alibaba が次々とストリーミングモデルを相次いで投入し、激しい競争が繰り広げられています。このような熾烈な競争環境では、ベンチマークで 0.3 ポイントのリードを取った程度では、すぐに抜かれる可能性が高いのです。
しかしメタには、この技術をさらに推し進めるための内在的な理由があります。同社が本気で取り組んでいる製品はすべて、メガネから Mac アプリに至るまで、可能な限り最高の性能で動作することが求められているからです。
(※記事の末尾にある「The New Stack」への出典表示は、原文の構成上、本文の一部として扱われますが、日本語読者にとって自然な流れを損なわないよう、本文の流れに統合せず、独立した文脈として残すか、あるいは記事の性質上、出典情報として扱うのが適切です。ただし、指示により「事実の捏造」や「原文にない情報の追加」は禁止されており、また「段落順と段落数を維持」するルールがあります。したがって、最後の一文も独立した段落として保持し、自然な日本語に訳します。)
メタがリアルタイム文字起こしで OpenAI や Google を上回ったという記事は、The New Stack に最初に掲載されました。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み