Microsoft AI、音声認識モデル「MAI-Transcribe-2」を公開し価格・速度で競合を上回る
本文の状態
日本語全文を表示中
詳細モードで約20分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Microsoft AI は音声認識モデル「MAI-Transcribe-2」を公開し、OpenAI や Google を下回る価格と速度を実現した。
AI深層分析を開く2026年9月6日 01:02
AI深層分析
キーポイント
圧倒的な価格競争力の確立
同社は新モデルの料金を時間あたり10セントに設定し、5 ヶ月前の価格から約72%削減した。
独自モデルによる戦略的転換
Microsoft AI は OpenAI 製技術への依存を脱却し、自社開発のフロンティア級モデルを製品へ順次組み込む戦略を進めている。
実環境に特化した機能強化
60言語対応や話者分離(Speaker diarization)、単語レベルの時系列情報など、実際のビジネス現場で発生する雑音や重なり音声への対応を強化した。
高度な機能の標準化と多言語対応
Word-level timestamps、キーワードバイアス、自動言語識別に加え、コンプライアンス用の「verbatim」モードや読みやすい「clean」モード、Hinglish や Spanglish などのコードスイッチングに対応している。これらの機能を専門ベンダーが割高で提供してきたものを、マイクロソフトは低価格で統合した。
FLEURS ベンチマークにおける性能と解釈
60言語での平均単語誤り率(WER)5.2% で FLEURS ベンチマークの 1 位を獲得したが、これは読み上げ音声に限定されたデータであり、前モデルよりカバー範囲が広がった結果として数値が上昇した可能性がある。購入者は言語ごとの詳細な内訳を要求する必要がある。
重要な引用
faster, more accurate, and cheaper than anything OpenAI, Google, or ElevenLabs currently sells
cuts that by roughly 72%
build its own frontier-class models one modality at a time
Specialty vendors have historically charged premiums for each of these capabilities. Microsoft is including all of them for a dime.
編集コメントを表示
編集コメント
Microsoft AI は自社モデルの性能向上だけでなく、価格破壊による市場支配力強化を明確に示した。これは OpenAI とのパートナーシップから自立する同社の意図が、単なる技術的な話ではなく経済的な競争優位性として具現化されたことを意味する。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Microsoft AI は木曜日、MAI-Transcribe-2 をリリースしました。同社によると、この音声認識モデルは OpenAI、Google、ElevenLabs が現在販売しているどの製品よりも高速で精度が高く、安価です。
そして驚くべきことに、料金は 1 時間あたり 10 セントに設定されました。
この数字には一呼吸置く必要があります。Microsoft AI がこのシリーズの最初のモデルを発売したのはわずか 5 ヶ月前ですが、その時は 1 時間あたり 0.36 ドルでした。今回の早期導入価格はその約 72% の値引きになります。
年間に 10 万時間のコールセンター通話データを処理する大規模な銀行や通信事業者にとって、これは決して過大な量ではありませんが、このレベルで計算すると請求額は 36,000 ドルから 10,000 ドルに下がります。これなら、トランスクリプションはもはや誰も議論しない経費項目となります。
2 年前であれば不可能だったと見なされた戦略を、マイクロソフトは実行し始めています。それは一度に一つのモダリティ(データ形式)ごとに最先端クラスのモデルを開発し、それらを徐々に OpenAI の技術に依存していた製品へ組み込んでいくというものです。この計画の中で最も進展が速いのが文字起こし(トランスクリプション)であり、MAI-Transcribe-2 はその成果を最も明確に示す証拠となっています。また、同社が 130 億ドルを投じて育成したパートナー企業への依存なく、世界で最も価値のあるソフトウェア企業がどのように AI で競争していくのかを示唆するものでもあります。
MAI-Transcribe-2 の機能と、その機能リストがエンタープライズ顧客にとって重要な理由
このモデルは 60 か国語の音声文字起こしに対応しており、6 月に公開された MAI-Transcribe-1.5 の 43 か国語や、4 月の初回リリース時の 25 か国語から大幅に拡張されています。Microsoft Foundry(開発者向けのモデルマーケットプレイス)上で動作し、テスト環境である MAI Playground でも利用可能です。マイクロソフトは、このモデルをクリーンなスタジオ環境ではなく、実際のビジネス現場で発生する雑音の多い音声や低品質な録音、重なり合う話し声といった「 messy audio」のために構築したと述べています。
言語数よりも重要なのは、マイクロソフトが基本製品にどのような機能をパッケージ化しているかです。スピーカー分離機能は、複数人の録音において誰が何を言ったかを整理し、単なる文字の壁と実用的な会議議事録の違いを生み出します。単語レベルの時系列情報は各単語に正確なタイムスタンプを付与するため、検索や編集、動画との同期が可能になります。キーワードバイアシング機能を使えば、開発者は薬品名や製品コード、従業員名などのリストをモデルに読み込ませることで、専門用語の誤変換を防げます。自動言語識別により、ユーザーは事前に言語を指定する必要がなくなります。
特に注目すべきは、2 つの機能です。1 つ目は設定可能な出力スタイルで、「verbatim(逐語録)」モードではコンプライアンスや法務チームのために「um」や言い淀み、つまずきなどをすべて保持します。一方、「clean」モードではフィラーを除去し、読みやすいキャプションやノートを作成できます。2 つ目はコードスイッチング機能で、文の途中で言語が切り替わる会話に対応します。マイクロソフトは特に「ヒンジリッシュ(英語とヒンディー語の混在)」や「スパングリッシュ(英語とスペイン語の混在)」を例に挙げており、これは顧客サービスでの通話中に1 回で十数回も言語が切り替わる可能性があるインドや米国ヒスパニック市場を意識したものです。これらの機能は従来、専門ベンダーがそれぞれ追加料金を請求する対象でしたが、マイクロソフトはこれらをすべて低価格で提供しています。
マイクロソフトの FLEURS および Artificial Analysis ベンチマーク主張の読み方
マイクロソフトは 3 つのパフォーマンス主張を行っていますが、それぞれ異なる測定基準に基づいています。技術的な購入担当者は、各主張が何を捉え、何を欠落させているかを理解しておく必要があります。
まず、MAI-Transcribe-2 は FLEURS ベンチマークにおいて 60 か国語で総合 1 位を達成し、平均単語誤り率(WER)は 5.2% です。FLEURS は 2022 年に Google の研究者らが公開したベンチマークで、母語話者約 2,000 文を読み上げる音声データを用いて構築されています。対象言語は 102 か国に及び、各言語あたり約 12 時間の音声が含まれています。
このベンチマークが多言語音声認識の標準的な指標となっているのは、同じ内容に対してスワヒリ語とスウェーデン語を公平に比較できる点にあります。単語誤り率は、人間による正解データとの照合において、置換・挿入・削除の総数をカウントしたものです。5.2% という数値は、約 20 単語に 1 つの誤りが含まれることを意味します。
ただし FLEURS は読み上げ音声(リードアラウド)を対象としており、自然な会話データではありません。また、Microsoft が発表している MAI-Transcribe-2 の平均誤り率 5.2% は、同年 6 月に報告された MAI-Transcribe-1.5 の 3.7% よりも悪化しています。
これは性能の低下というよりは、対応言語のカバー範囲が広がった結果と考えられます。43 か国から 60 か国へと対象を拡大したことで、どのモデルでも困難な低リソース言語が含まれるようになったためです。購入を検討する際は、言語ごとの詳細な誤り率データも併せて確認することをお勧めします。
2 つ目の主張は、このモデルが Artificial Analysis の 単語誤り率リーダーボード で第 2 位にランクされ、同社の精度とレイテンシの最適解(パレートフロンティア)を定義しているという点です。Artificial Analysis は独立したベンチマーキング機関で、各モデルのパブリック API を通じてテストを行い、顧客が実際に得られる性能を測定しています。その評価指標には、シミュレーションされたエージェント間の会話、欧州議会の演説、企業の決算説明会などが組み合わされており、特に英語のビジネス音声に重きを置いています。
昨年 6 月、同社は MAI-Transcribe-1.5 を単語誤り率(WER)2.4% で第 3 位と評価しました。これはアリババの Fun-Realtime-ASR-preview や ElevenLabs の Scribe v2 に次ぐ順位でしたが、トップ 10 の中では最速であると指摘していました。今回の第 2 位への昇格は、Microsoft が ElevenLabs を上回ったことを示唆しています。
「パレートフロンティア」という用語に注目すべきです。これは、精度においてこのモデルを上回る競合他社が存在しないか、存在しても速度が劣ることを意味します。逆に、速度で上回るモデルはあっても、その精度はこのモデルには及ばないのです。
3 つ目の主張は、圧倒的な処理速度です。Artificial Analysis の評価によると、OpenAI の GPT-Transcribe より 10 倍、ElevenLabs の Scribe v2 より 7 倍、Google の Gemini 3.5 Transcribe よりも 5 倍高速です。バッチ処理では速度が最重要というわけではありませんが、スループットとコストは大きな要因となります。リアルタイムの 300 倍で動作するモデルは、30 倍のモデルに比べて必要な GPU ハウリングを大幅に削減できます。この効率性が、マイクロソフトが 10 セントという低価格を設定しても利益を出せる理由です。
5 ヶ月間で 3 つの音声モデル:Microsoft AI の驚異的なリリースペース
そのスピードこそが、本質的な物語です。4 月 2 日に MAI-Transcribe-1 が発表され、25 言語に対応し、料金は時間あたり 0.36 ドルでした。6 月 2 日には MAI-Transcribe-1.5 が登場し、対応言語が 43 に増え、キーワードバイアス機能や Artificial Analysis のランキングで 3 位を獲得しました。そして今日、MAI-Transcribe-2 がリリースされ、対応言語は 60 に達し、話者分離やタイムスタンプ機能、コードスイッチングへの対応も実現。さらに Artificial Analysis のランキングで 2 位に躍り出るとともに、料金は時間あたり 0.10 ドルへと大幅に引き下げられています。
5 ヶ月間で 3 つのリリースが行われ、それぞれで言語対応範囲が約 40% 拡大し、競合他社が有料プランに課金している機能も追加されています。このペースは、安定したアーキテクチャを確立し、現在はデータとスケールという「回転軸」を回しているチームの特徴です。音声モデルはこの段階で急速かつ予測可能に性能向上が見られる時期であり、同時に誰よりも先に文字起こしをコモディティ化しようとする企業の意図の表れでもあります。
このスピードを支える組織的な賭けは、Microsoft AI の最高経営責任者である Mustafa Suleyman 氏が The Verge に 4 月に語った内容 で説明されています。彼は最初のモデルについて、「官僚主義から解放された、小規模で集中した 10 人チーム」が手がけたと明かしました。一方、より大きな周辺チームはベンダー管理やデータ収集を担当しています。
また Suleyman 氏は The Verge の取材に対し、このモデルは他の最先端モデルと比較して「GPU コストの半分」で稼働していると述べ、「Microsoft にとって巨額のコスト削減になる」と評価しました。Meta、Amazon、Google、Anthropic も同様の扁平化された組織構造を試みたことがありますが、The Verge は指摘しています。Microsoft の文字起こしラインは、このアプローチが研究論文ではなく実用的なビジネス成果を生み出すかどうかを問う、最も目に見えるテストケースとなっています。
なぜマイクロソフトは、130 億ドルの OpenAI 投資にもかかわらず独自 AI モデルの開発を続けるのか
マイクロソフトは OpenAI にすでに 130 億ドル以上を投資しており、Azure や Office、Copilot といった自社のプラットフォームで OpenAI のモデルも提供しています。過去 4 年ほど、「マイクロソフトが自社でモデルを開発する意味はあるのか?」という疑問が常にありました。しかし、この問いに対する答えはここ一年で明確になりつつあります。その核心は「自立」にあります。
2024 年 3 月、マイクロソフトがインフレーション AI からムスタファ・スレイマン氏を招聘し、同社のスタッフの大半も引き抜いた際、セールフォースの Marc Benioff CEO はこれを明確な意図表明と捉えました。「マイクロソフトは自前の AI を構築している。将来的に OpenAI に依存するとは思わない。彼らには独自の最先端モデルが必要だ」と、Benioff 氏は 2025 年 1 月に CNBC の取材で語っています。「だからこそムスタファ・スレイマン氏を雇ったのだ」。ベンチフ氏の発言にはセールフォースとマイクロソフトの競合関係や、同社が Anthropic に投資しているという独自の事情も背景にありますが、その予測はほぼ的中しました。
2025 年 10 月、Microsoft と OpenAI はパートナーシップを再構築しました。この契約により、Microsoft の発表によると、同社は初めて「AGI(汎用人工知能)の追求を他社との提携を含め独自に実施できる」ようになりました。Suleyman氏は The Verge の取材に対し、再交渉によって「Microsoft がスーパーインテリジェンスの追求を進める能力が解放された」と述べています。その数週間後、Microsoft は MAI スーパーインテリジェンスチームの設立を発表しました。
2026 年 4 月には両社は契約をさらに改正し、Microsoft の OpenAI モデルへの独占的アクセス権を終了させると同時に、同社が支払っていた収益配分も廃止されました。当時の報道によると、これらの改定は双方の結びつきを緩める方向に作用しました。そして、そのたびに MAI 関連の新しいモデルが続々と発表されています。
Microsoft 自社モデルが Teams、Word、Excel でコスト削減を実現する仕組み
もう一つの答えは利益率にあります。Microsoft が OpenAI のモデルにルーティングするプロンプト一つひとつにはコストがかかりますが、自社の GPU で動作する自社モデルにルーティングすれば、そのコストはより小さくなります。
7 月、Bloomberg は Microsoft が Word や Excel におけるユーザーの問い合わせの一部を、MAI モデルで回答し始めたことを報じました。これらの製品はこれまで OpenAI や Anthropic の技術によって支えられていると宣伝されてきました。TechCrunch はこの転換を、Amazon、Uber、Meta、Accenture も同様に支出を削減しているとされる AI 分野全体での見直しの一環として捉えています。
音声文字起こしは、この置き換えの最初の自然な標的となります。なぜなら課題が限定されており、評価指標が客観的なためです。
マイクロソフトは Teams を所有しており、そこで膨大な量の会議音声が生成されています。また、臨床記録事業を音声認識に依存している Nuance も保有しています。さらに、数千の企業がすでに利用している Azure の音声サービスもマイクロソフト傘下です。これらのすべての業務負荷が MAI-Transcribe-2 への移行候補となります。そして、1 時間でも早く移行すればするほど、マイクロソフトは他社に支払う必要がなくなるのです。
スレイマン氏は、これがまさに狙いであると異例なほど率直に語っています。「スーパーインテリジェンスとは、結局のところ、『我々を頼りに世界クラスの言語モデルを提供している数百万の企業に対して、これらのモデルが生産価値をもたらすことができるか』という問いである」と、彼は 4 月に The Verge のインタビューで述べています。文字起こし API に「スーパーインテリジェンス」という言葉を適用することに賛成するかどうかは別として、商業的な論理は明白です。一度能力を構築すれば、12 以上の製品に展開し、競合化しつつあるパートナーへの支払いを停止すればよいのです。
MAI-Transcribe-2 と OpenAI、Google、ElevenLabsの競合状況
Microsoft の発表では、4 つの主要なライバルが名指しされています。OpenAI の GPT-Transcribe、Google の Gemini 3.5 Transcribe、OpenAI の旧版である Whisper V3-Large、そして ElevenLabs の Scribe v2 です。
一方、Deepgram、AssemblyAI、Speechmatics、Rev といった企業名は言及されていません。これらは過去10年にわたり、エンタープライズ向けに音声文字起こしサービスを展開してきた専門業者です。Microsoft は既存の市場参入企業ではなく、最先端の研究機関(フロンティア・ラボ)との競争を想定しているのです。
この見方は、マーケティングの側面と事実の側面の両方を含んでいます。大手研究機関は、音声処理を広範なプラットフォームの必須機能の一つとして扱い、それに相応しい価格を設定してきました。しかし、速度でそれらを5〜10倍上回りながら精度も同等に保つ専用モデルは、明確な差別化要因となります。ただし、専門特化したベンダーほど価格競争の影響を強く受けることになります。
Microsoft は 1 時間あたり 0.10 ドルという価格設定で、多くの競合他社が企業向けの高ボリューム契約で設定している水準にまで、あるいはそれ以下まで引き下げています。さらに、話者分離(ダイアライゼーション)、タイムスタンプ、60 か国語のサポートを基本料金に含まれています。専門特化型ベンダーが残す防衛壁は、医療用語や法務フォーマットといったドメイン固有の深さ、業界特有の統合機能にあります。Microsoft のキーワードバイアス機能は、まさにこの領域を狙い撃ちしたものです。
Microsoft が精度で凌駕すると明言していない唯一の競合は Alibaba です。同社のモデルは 2026 年の大半において、独立系のリーダーボードで首位を維持してきました。TechCrunch は 7 月、セキュリティ上の懸念があるにもかかわらず、一部の米国企業がより安価な代替手段として中国製モデルの評価を開始したと報じています。
Microsoft がこれらの購入者に対して提示するメッセージは暗黙的ですが、疑いの余地がありません。「同等の精度」「高速な推論」「低価格」、そしてコンプライアンスチームがすでに信頼しているベンダーです。
音声認識ベンダーを乗り換える前に、技術決定権を持つ人が問うべき質問
ベンチマークに関する詳細なデータが提示されている一方で、このリリースではいくつかの実践的な疑問が残されています。まず「利用期間」についてです。マイクロソフトは「1 時間あたり 0.10 ドル」という価格をローンチキャンペーンとして発表していますが、終了日や標準料金の明言はありません。コスト計算モデルを構築する際は、必ず書面でこれらの情報を確認すべきです。
次に「ストリーミング対応」の可否です。今回のリリースではバッチ処理のスループットや長尺音声への対応が強調されていますが、ボイスエージェントやライブ字幕に不可欠なリアルタイム文字起こしについては一切言及されていません。Artificial Analysis が独自に運営するストリーミング性能ランキングにおいて、マイクロソフトが沈黙している点は注目すべきです。
3 番目の課題は「言語ごとの精度」です。60 言語平均で誤り率 5.2% という数字は、主要言語では 3% 程度だが、リソースが少ない言語では 12% に達する可能性も示唆しています。特定の言語での利用を想定する購入者は、実際にその言語でテストを行うべきです。
4 つ目は「話者分離(ダイアライゼーション)の品質」です。単語誤り率(WER)は話者の特定能力を測定する指標ではありません。WER がほぼ完璧な文字起こしであっても、文ごとに話者を間違えて割り当ててしまうケースがあり得ます。今回のリリースでは、話者分離誤り率やこれに相当する評価指標の提示はありませんでした。
5 つ目はデータ処理の問題です。エンタープライズ向けの文字起こしは医療記録、法的特権、財務開示などに関わるため、発表文にはデータの所在(レジデンシー)、保持期間、あるいは Foundry に提出された音声データが将来の学習に利用されるかどうかについての言及がありませんでした。The Verge によると、マイクロソフトが 4 月に発表した内容では、訓練データは「人間が選別した録音」「契約者が記録したノイズの多い音声」、そして「オープンウェブからの膨大なデータ」を混ぜ合わせたものだとされています。これは規制業界からは鋭い質問を投げかけられるべき記述です。
これらの欠落自体は発表文としては珍しくありませんが、リーダーボードでの勝利と実際の業務導入を分けるのはまさにこうした点への回答の有無なのです。
マイクロソフトの音声モデル戦略が示す、より広範な AI 野望
音声認識の詳細から一歩引いて見ると、文字起こしを超えた明確なパターンが見えてきます。現在、マイクロソフトの AI ユニットは画像、音声、文字起こし、コード、推論、サイバーセキュリティ向けにモデルを次々とリリースしています。6 月の Build では、単一の基調講演で 7 つの新規 MAI モデル を発表しました。
いずれも同じ戦略を採用しています。明確に定義されたモダリティ(データ形式)をターゲットにし、推論コストの最適化を徹底し、最先端研究所よりも低価格で提供し、Foundry を通じて流通させ、そして静かにマイクロソフト自社製品への組み込みを進めるというものです。
これは、GPT や Gemini のすべての分野で勝つ単一のモデルを作ろうとする試みではありません。むしろ、専門的なモデルをポートフォリオとして構築し、それらを組み合わせることで、Microsoft が他社への支払いなしに企業向けワークロードの大部分を処理できるようにし、余剰容量を競合他社の専門家が提供できない価格で販売するという戦略です。
音声認識(トランスクリプション)は、このアプローチが初めて完全に成熟した分野に過ぎませんが、リリースノートは製品発表というよりはテンプレートのように読めます。MAI-Transcribe-2 の詳細は、まさにその典型です。
スレイマン氏は過去 2 年間、「人道的な超知能」や「ユーザーに責任を持ち、彼らの味方である AI アシスタント」について語ってきました。言葉は高邁ですが、実行は表計算ソフトの世界です。5 ヶ月前、Microsoft は音声からテキストへの変換で 1 時間あたり 36 セントを請求していました。しかし先週木曜日には、料金を 10 セントに引き下げ、競合他社が別々に販売している 6 つの機能を無料で提供し、業界標準の多言語ベンチマークでトップの座を確保しました。
最先端 AI のコストを学ぶために 130 億ドルを投じた同社は、成果物をレンタルするのではなく、自らの工場を所有することを選んだのです。そして今、その成果物はレンタル料よりも安い価格で販売されています。
「MAI-Transcribe-2」は、Microsoft Foundry および MAI Playground を通じて、現在利用可能です。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み