Microsoft AI、音声認識モデル「MAI-Transcribe-2」を価格・速度で他社上回る形で公開
本文の状態
日本語全文を表示中
詳細モードで約20分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
VentureBeat AI
Microsoft AI は音声認識モデル「MAI-Transcribe-2」を公開し、OpenAI や Google の既存製品より安価かつ高速な価格設定で提供すると発表した。
AI深層分析を開く2026年9月3日 23:57
AI深層分析
キーポイント
劇的な価格引き下げと競争優位性
Microsoft AI は同モデルの料金を時間あたり 10 セントに設定し、5 ヶ月前の 36 セントから約 72% 削減した。この価格変更により、大規模な企業における音声認識コストが劇的に低下する。
独自モデル戦略の実現と他社依存からの脱却
Microsoft は OpenAI とのパートナーシップから離れ、自社のフロンティア級モデルを段階的に製品に組み込む戦略を推進している。音声認識分野でのこの新リリースは、その戦略が最も早く進展した証拠となる。
エンタープライズ向け高度機能の標準化
同モデルは 60 か国語に対応し、話者分離、単語レベルの時系列データ、キーワードバイアス、自動言語識別などの機能を基本パッケージに含んでいる。さらに、コンプライアンス対応や多言語混在会話への対応も標準機能として提供される。
FLEURS ベンチマークの限界と平均誤差率の上昇
Microsoft の MAI-Transcribe-2 は FLEURS で 60 か国で 5.2% の平均単語誤り率を記録したが、これは読話に限定されたベンチであり、前バージョンから数値が上昇している。この変化は低リソース言語の追加によるカバー範囲の拡大によるものであり、購入者は言語別の詳細データを確認する必要がある。
Artificial Analysis における精度と速度のパレート最適
同モデルは Artificial Analysis のリーダーボードで第2位となり、精度を犠牲にせず速度を向上させるか、速度を犠牲にせずに精度を高める競合が存在しないパレートフロンティアを定義している。これは英語中心のビジネス会話や会議録音などを実際の API 経由でテストした独立ベンチマーキングの結果である。
重要な引用
Microsoft AI on Thursday released MAI-Transcribe-2, a speech-recognition model the company says is faster, more accurate, and cheaper than anything OpenAI, Google, or ElevenLabs currently sells.
Thursday's early-bird price cuts that by roughly 72%.
The release arrives as Microsoft executes a strategy that would have seemed implausible two years ago: building its own frontier-class models one modality at a time, then steadily swapping them into products that once ran on OpenAI's technology.
"Pareto frontier" is the phrase practitioners should note: it means no rival beats the model on accuracy without being slower, and none beats it on speed without being less accurate.
編集コメントを表示
編集コメント
Microsoft は OpenAI との戦略的パートナーシップから離れ、自社のモデルを製品に組み込むスピードを加速させている。特に音声認識分野での価格破壊は、業界全体の競争環境を大きく変える可能性を秘めている。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Microsoft AI は木曜日、MAI-Transcribe-2 という音声認識モデルを公開しました。同社によると、このモデルは OpenAI、Google、ElevenLabs が現在販売しているどの製品よりも高速で精度が高く、安価です。そして驚くべきことに、料金は 1 時間あたりわずか 10 セントに設定されました。
この価格には一瞬立ち止まって考える必要があります。Microsoft AI が同シリーズの最初のモデルをリリースしたのはたった 5 ヶ月前ですが、その際は 1 時間あたり 0.36 ドルを請求していました。木曜日に発表されたこの早期割引価格は、それを約 72% も引き下げたことになります。年間 10 万時間の通話センター音声データを処理する大規模な銀行や通信事業者にとって、これは決して過小評価できないボリュームです。しかし、その場合の費用は従来の 36,000 ドルから 10,000 ドルへと劇的に低下します。この価格帯になれば、転写サービスはもはや予算議論の対象となるような高額な項目ではなくなります。
今回のリリースは、2 年前であれば不可能だったと見なされた Microsoft の戦略が現実味を帯びていることを示しています。つまり、一度に一つのモダリティ(データ形式)ごとに最先端クラスのモデルを開発し、それを OpenAI の技術に依存していた製品へと着実に組み込んでいくという方針です。転写機能はこの計画の中で最も急速に進化している分野であり、MAI-Transcribe-2 はその成果を如実に示す決定的な証拠となっています。また、Microsoft が 130 億ドルを投じて育成したパートナーに依存することなく、世界で最も価値あるソフトウェア企業が AI でどのように競争していくのかを示唆する-preview でもあります。
MAI-Transcribe-2 の機能と、それがなぜ企業購入者にとって重要なのか
このモデルは、60 言語の音声 transcription をサポートします。これは 6 月の MAI-Transcribe-1.5 の 43 言語や、4 月の初回リリース時の 25 言語から大幅に増加した数値です。Microsoft Foundry(開発者向けのモデルマーケットプレイス)および MAI Playground(テスト環境)上で動作します。
Microsoft は、このモデルをクリーンなスタジオ環境ではなく、実際のビジネス現場で発生する雑音や低品質な録音、重なり合う音声といった「生々しい」音声データのために構築したと述べています。
言語数の増加以上に重要なのが、基本機能に盛り込まれた技術です。スピーカーダイアライゼーション(Speaker diarization)は、複数人の会話において誰が何を話したかを識別し、ただの文字の羅列を意味のある会議議事録へと変えます。単語レベルの時系列情報(Word-level timestamps)により、各単語に正確なタイムスタンプが付与され、検索や編集、動画との同期が可能になります。
キーワードバイアシング機能を使えば、開発者は薬品名や製品コード、従業員名などのリストをモデルに提供できます。これにより、専門用語が誤変換されるのを防ぎます。さらに、自動言語識別機能により、ユーザーは事前に使用する言語を指定する必要もなくなりました。
2 つの機能は、その特異性において際立っています。設定可能な出力スタイルには、「verbatim」モードがあり、これはコンプライアンスや法務チームのために「um」や言い淀み、つまずきなどのすべての要素をそのまま残します。一方、「clean」モードではフィラー( filler)を除去し、読みやすい字幕やノートを作成できます。また、コードスイッチング機能は、文の途中で言語が切り替わる会話にも対応しています。マイクロソフトは特に「ヒンジリッシュ」と「スパニッシュ」に言及しており、これはインド市場と米国ヒスパニック市場を意識したものです。これらの市場では、1 件のカスタマーサポート通話で言語が十数回も切り替わることが珍しくありません。こうした機能は従来、専門ベンダーが高額な料金を請求する対象でしたが、マイクロソフトはこれらすべてを極めて低価格で提供しています。
Microsoft の FLEURS および Artificial Analysis ベンチマークの主張を読み解くには
マイクロソフトは 3 つのパフォーマンス主張を行っていますが、それぞれが異なる測定基準に基づいています。技術的な購入担当者は、各主張が何を捉えており、何が欠落しているのかを理解する必要があります。
まず、MAI-Transcribe-2 は FLEURS ベンチマークで 60 の言語において 1 位を獲得し、平均単語誤り率(WER)は 5.2% です。FLEURS は Google の研究者らが 2022 年に発表したベンチマークで、102 の言語それぞれについてネイティブスピーカーが約 2,000 文を読み上げる音声データから構成されています。これは各言語あたり約 12 時間に相当する規模です。
このベンチマークは多言語音声認識の標準的な指標として広く使われています。なぜなら、同じ内容の音声に対してスワヒリ語とスウェーデン語を公平に比較できるからです。単語誤り率という評価指標は、人間の正解データに対して「置き換え」「挿入」「削除」がどれだけ発生したかを数えたものです。5.2% という値は、およそ 20 語に 1 語の割合で誤りが含まれていることを意味します。
ただし注意すべき点は、FLEURS は読み上げ音声(リードアラウド)を対象としており、自然な会話データではないことです。また、Microsoft が報告した MAI-Transcribe-1.5 の 3.7% から平均値が上昇していることも事実です。これは性能の低下というよりは、カバーする言語範囲が広がった結果と考えられます。43 か国から 60 か国へと対象を拡大し、あらゆるモデルが苦戦する低リソース言語も含まれるようになったためです。
そのため、導入を検討する企業や開発者は、単なる平均値だけでなく、言語ごとの詳細な誤り率の内訳を必ず確認すべきでしょう。
2 つ目の主張は、このモデルが Artificial Analysis の単語誤り率(WER)リーダーボードで 2 位にランクされ、同社の精度と遅延の最適解(パレートフロンティア)を定義しているという点です。Artificial Analysis は独立したベンチマーキング機関であり、各モデルのパブリック API を通じてテストを行い、顧客が実際に得られる性能を測定しています。その評価指標には、シミュレーションされたエージェント間の会話、欧州議会の演説、企業の決算説明会などが組み合わされており、特に英語のビジネスシーンに重きを置いています。
昨年 6 月には、MAI-Transcribe-1.5 は WER 2.4% で 3 位にランクされ、アリババの Fun-Realtime-ASR-preview や ElevenLabs の Scribe v2 に次ぐ結果でした。しかし、同社はトップ 10 入りのモデルの中で最も高速であると評価していました。今回の 2 位への昇進は、Microsoft が ElevenLabs を抜いたことを示唆しています。
ここで「パレートフロンティア」という用語に注目すべきです。これは、精度で競うなら他社がこれより速くすることはできず、速度で競うなら他社がこれより正確になることはできない、つまり両方の面で競合他社を凌駕している状態を意味します。
3 つ目の主張は、圧倒的な速度です。Artificial Analysis の評価によると、OpenAI の GPT-Transcribe より 10 倍、ElevenLabs の Scribe v2 より 7 倍、Google の Gemini 3.5 Transcribe より 5 倍も高速です。
バッチ処理による文字起こしでは、速度は「待ち時間」よりも「スループット(単位時間あたりの処理量)」とコストの観点で重要になります。リアルタイムの 300 倍の速度で動作するモデルは、同様に 30 倍の速度のモデルに比べて必要な GPU ハウリング時間の数分の一で済みます。この効率性が、Microsoft が 1 ドル(10 セント)という低価格で提供でき、かつ依然として利益を確保できる理由です。
5 ヶ月間で 3 つの音声モデル:Microsoft AI の驚異的なリリースペース
この業界の真の物語は、そのスピードにあります。4 月 2 日に MAI-Transcribe-1 が 25 言語対応で時間あたり 0.36 ドルという価格で登場しました。続く 6 月 2 日には、MAI-Transcribe-1.5 が 43 言語に対応し、キーワードのバイアス機能も追加され、Artificial Analysis のランキングでは第 3 位を獲得しています。
そして今日、MAI-Transcribe-2 が登場しました。対応言語は 60 言語に拡大し、話者分離(diarization)やタイムスタンプ付与、コードスイッチングへの対応も実現。Artificial Analysis のランキングでは第 2 位となり、価格はなんと時間あたり 0.10 ドルです。
わずか 5 ヶ月間で 3 つのバージョンがリリースされ、言語カバー範囲は毎回約 40% ずつ拡大し、競合他社がプレミアムプランでしか提供しない機能を次々と追加しています。この開発ペースは、安定したアーキテクチャを確立し、現在はデータとスケールに注力しているチームの特徴を示しています。音声モデルはこの段階で急速かつ予測可能な形で進化するのが一般的です。同時に、誰よりも先に文字起こし技術をコモディティ化しようとする企業の意図も表れています。
このスピードを支える組織的な決断について、Microsoft AI の最高経営責任者(CEO)である Mustafa Suleyman 氏は、4 月に The Verge の取材でこう語っています。最初のモデルは「官僚主義から解放された、10 名規模の集中したチーム」によって開発されたと明かし、より大きな組織がベンダー管理やデータ収集といった周辺業務を担っていると説明しました。
同氏は The Verge に対し、このモデルは他社の最先端モデルと比較して GPU コストが半分であると明かし、「Microsoft にとって大きなコスト削減になる」と評価しました。Meta、Amazon、Google、Anthropic も同様のフラットな構造を試していますが、The Verge は Microsoft のトランスクリプションラインが、このアプローチが研究論文ではなく実際の商業成果を生み出すかどうかを問う最も目に見える試行であると指摘しています。
Microsoft が OpenAI への 130 億ドルの投資にもかかわらず独自 AI モデルを開発する理由
Microsoft は OpenAI に 130 億ドル以上を投資し、Azure や Office、Copilot で OpenAI のモデルを提供しています。ここ数年、Microsoft 製モデルに関する最も明白な疑問は「なぜわざわざ作るのか?」でした。しかしこの答えは過去 1 年間で明確になりつつあり、その核心は「自立」にあります。
2024 年 3 月、Microsoft が Inflection AI から Mustafa Suleyman 氏を筆頭とする同社スタッフの大半を引き抜いた際、Salesforce の Marc Benioff CEO はこれを意図表明と受け取りました。「Microsoft は独自の AI を構築しており、将来的に OpenAI を利用するとは思わない。彼らには自社の最先端モデルがあるだろう」と Benioff 氏は 2025 年 1 月の CNBC のインタビューで語りました。「だからこそ Mustafa Suleyman を雇ったのだ」。Benioff 氏自身にも独自の動機があり、Salesforce は Microsoft と競合し Anthropic にも投資していますが、その予測はほぼ的中しました。
2025 年 10 月、マイクロソフトと OpenAI はパートナーシップを再構築しました。マイクロソフトの発表によると、この契約により同社は初めて「他社との提携を含め、AGI(汎用人工知能)の独自開発」が可能になりました。Suleyman 氏は The Verge の取材に対し、「再交渉によって超知能の開発への道が開かれた」と述べています。その数週間後、マイクロソフトは MAI Superintelligence チームの設立を発表しました。
その後、2026 年 4 月には契約がさらに改定されました。当時の報道によると、この改定によりマイクロソフトは OpenAI のモデルへの独占アクセス権を失い、収益配分の支払いも廃止されています。これらの改定は両社の結びつきを緩める方向に作用し、そのたびに MAI モデルの登場が続きました。
マイクロソフトが自社開発したモデルによって、Teams や Word、Excel などのコスト削減が進んでいます
もう一つの重要な要素は利益率です。OpenAI のモデルへルーティングされるプロンプトにはコストがかかりますが、マイクロソフトが自社の GPU で処理する自社モデルへのプロンプトでは、そのコストはより小さくなります。
7 月、Bloomberg はマイクロソフトが Word や Excel 内の一部のプロンプト回答に MAI モデルの使用を開始したと報じました。これらの製品はこれまで OpenAI や Anthropic の技術によって支えられていると宣伝されていました。TechCrunch はこの転換を、Amazon、Uber、Meta、Accenture も同様に AI 関連支出の削減に踏み切った業界全体の動向の一部として捉えています。
文字起こしは、この置き換えの最初の自然な標的となります。なぜなら、この課題は範囲が限定されており、評価指標も客観的なものだからです。
マイクロソフトは Teams を所有しており、そこで膨大な量の会議音声が発生します。また、臨床文書作成事業を音声認識に依存している Nuance も傘下に収めています。さらに、数千の企業がすでに利用している Azure の音声サービスも保有しています。これらのすべてのワークロードが MAI-Transcribe-2 への移行候補となり得ます。移行が進む每一時間は、マイクロソフトが他社に支払う必要がなくなる時間でもあります。
スレイマン氏は、これがまさに狙いであると異例なほど率直に語っています。4 月に The Verge の取材に対し、「スーパーインテリジェンスとは、究極的には『我々の世界クラスの言語モデルに依存する数百万の企業が製品価値を得られるか』という問いである」と述べていました。文字起こし API に「スーパーインテリジェンス」という言葉を適用することに賛否あるとしても、その商業的な論理は明白です。一度能力を構築すれば、十数個のプロダクトに展開し、次第に競合化していくパートナーへの支払いを停止するのです。
MAI-Transcribe-2 vs. OpenAI, Google, and ElevenLabs: the competitive picture
マイクロソフトの発表では、4 つのライバルが名指しされています。OpenAI の GPT-Transcribe、Google の Gemini 3.5 Transcribe、OpenAI の旧型 Whisper V3-Large、そして ElevenLabs の Scribe v2 です。Deepgram、AssemblyAI、Speechmatics、Rev については言及されていません。これらは過去 10 年にわたり企業向けに文字起こしサービスを提供してきた専門業者です。マイクロソフトは、既存の市場支配者ではなく、最先端の研究ラボを相手に戦いを挑んでいるのです。
この評価は、マーケティングの一部でありながら、同時に真実でもあります。主要な研究機関たちは、音声認識を広範なプラットフォームの必須機能として扱い、それに相応しい価格を設定してきました。しかし、精度を維持しつつ速度を 5 倍から 10 倍向上させた専用モデルは、明確な差別化要因となります。ただし、専門的なサービスを提供する企業にとって、価格競争圧力は最も厳しいものとなるでしょう。
Microsoft は 1 時間あたり 0.10 ドルという価格設定で、多くの企業が高ボリュームのエンタープライズ契約を結んでいる水準を下回るか同水準に抑えています。さらに、話者分離(diarization)、タイムスタンプ、60 カ国語への対応を基本料金に含まれています。専門企業が残す競争優位性は、医療用語や法的フォーマットといったドメイン特有の深さ、業界固有の統合機能にあります。Microsoft のキーワードバイアシング機能は、まさにこの領域を狙い撃ちしたものです。
精度において Microsoft が明確に競合と主張していない唯一の相手は Alibaba です。同社のモデルは 2026 年の大半で独立系のリーダーボードで首位を維持してきました。TechCrunch は 7 月、セキュリティ上の懸念があるにもかかわらず、一部の米国企業がより安価な代替手段として中国製モデルの評価を開始したと報じました。Microsoft がこれらの購入者に対して提示するメッセージは暗黙的ですが、明白です。「同等の精度、高速な推論、低価格、そしてコンプライアンスチームがすでに信頼しているベンダー」。
音声認識ベンダーを切り替える前に技術的な意思決定者が問うべきこと
ベンチマークにおける具体的な数値に言及している一方で、このリリースでは実用上のいくつかの疑問が未解決のまま残されています。まず注目すべきは「利用時間」です。マイクロソフトは 1 時間あたり 0.10 ドルをローンチ時の特別価格として提示していますが、終了日や標準料金の明示はありません。コスト計算モデルを構築する際は、これらの条件を必ず書面で確認する必要があります。
次に重要なのが「ストリーミング対応」の有無です。今回のリリースではバッチ処理のスループットや長尺音声への対応が強調されていますが、音声エージェントやライブ字幕に必要なリアルタイム文字起こしについては一切言及されていません。Artificial Analysis が独自に運営するストリーミング性能のランキングにおいてマイクロソフトが沈黙している点も、この欠如を裏付けています。
三つ目の課題は「言語ごとの精度」です。60 言語で平均 5.2% の誤り率という数字は、主要言語では 3% 程度だが、リソースが少ない言語では 12% に達する可能性も示唆しています。特定の言語での利用を想定している購入者は、実際にその言語でテストを行うべきです。
最後に「話者識別(ダイアライゼーション)の精度」の問題があります。単語誤り率(WER)は話者の特定能力を測る指標ではないため、WER がほぼ完璧なテキストでも、文ごとに話者を間違えて割り当ててしまう可能性があります。今回のリリースでは、ダイアライゼーション誤り率やこれに相当する評価指標の開示がありません。
5 つ目はデータ処理に関する課題です。エンタープライズ向けの文字起こしは医療記録、法的特権、財務開示などにも関わるため、発表文にはデータの所在(レジデンシー)、保持期間、あるいは Foundry に提出された音声データが将来の学習に利用されるかどうかについての言及がありませんでした。The Verge によると、マイクロソフトが 4 月に発表した内容では、訓練データは「人間が選別した録音」「契約者が記録したノイズの多い音声」、そして「オープンウェブからの膨大なデータ」を混ぜ合わせたものだと説明されています。この説明は、規制産業から鋭い質問を投げかけられるべき内容です。
これらの欠落自体は発表という場では珍しいことではありませんが、リーダーボードでの勝利と実際の業務導入を分けるのはまさにこうした疑問への答えです。
マイクロソフトの音声モデル戦略が示す、より広範な AI への野望
文字起こしの技術詳細から一歩引いて見ると、その先には単なる文字起こしを超えた明確なパターンが見えてきます。マイクロソフトの AI ユニットは現在、画像、音声、文字起こし、コード、推論、サイバーセキュリティといった分野でモデルを次々と提供しています。6 月の Build では、たった一つの基調講演で 7 つの新規 MAI モデルを発表しました。
それぞれのモデルが共通して採用している戦略は以下の通りです。特定のモダリティ(データタイプ)にターゲットを絞り、推論コストの最適化を徹底的に行い、最先端ラボよりも低価格で提供し、Foundry を通じて流通させ、そして静かにマイクロソフト自社の製品へと組み込んでいくというものです。
これは、GPT や Gemini のすべての分野で勝つ単一のモデルを構築しようとする試みではありません。むしろ、専門的なモデルのポートフォリオを構築し、それらを組み合わせることで、Microsoft が他社への支払いなしに自社のエンタープライズワークロードのほとんどを処理できるようにし、余剰キャパシティを競合他社が提供できない価格で販売するという戦略です。
このアプローチが初めて完全に成熟したのが音声文字起こしでした。しかし、MAI-Transcribe-2 のリリースノートは製品発表というよりは、ある種のテンプレートのように読めます。
スレイマン氏は過去 2 年間、「人道的なスーパーインテリジェンス」や「ユーザーに責任を持ち、味方となる AI アシスタント」について語ってきました。その言葉遣いは高邁ですが、実際の執行は表計算ソフトのようです。5 ヶ月前、Microsoft は音声 1 時間をテキストに変換するのに 36 セントを請求していました。しかし先週木曜日には、料金を 10 セントに引き下げ、競合他社が別々に販売している 6 つの機能を無料で提供し、業界標準の多言語ベンチマークでトップの座を確保しました。
最先端 AI のコストについて 130 億ドルを費やして学んだ同社は、成果物をレンタルするのではなく、製造工場そのものを所有することを選んだのです。そして今、その成果物をレンタル料よりも安く販売しています。
MAI-Transcribe-2 は現在、Microsoft Foundry および MAI Playground から利用可能です。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み