Microsoft、最良の音声認識モデル「MAI-Transcribe-2」を公開
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
マイクロソフトは音声認識モデル「MAI-Transcribe-2」を公開し、60言語での高精度な文字起こしと低遅延を実現して市場価格を下回る料金で提供すると発表した。
AI深層分析を開く2026年9月6日 00:52
AI深層分析
キーポイント
競合他社を上回る性能と効率性
同社は新モデルがGemini 3.5 TranscribeやGPT-Transcribeなどの主要競合を凌駕し、Pareto Frontier(最適解の境界)を定義する精度と速度を達成したと発表した。
多言語対応と高精度な評価
FLEURSベンチマークで60言語平均単語誤り率5.2%を記録し、1位を獲得したほか、Artificial Analysisの精度・遅延指標でも首位に立った。
実用機能を統合した単一モデル
話者識別(diarization)、設定可能な文字起こしスタイル、単語レベルの時系列データといった機能を1つのモデルで実現し、臨床・法務・アクセシビリティなどの多様な用途に対応する。
市場最安水準の価格設定
同社によると、この高性能な機能を提供しながらも、1時間あたり0.10ドルという市場で最も低い価格で利用可能になると発表した。
多機能な単一モデルによる課題解決
MAI-Transcribe-2 は、推論速度の向上や話者分離、単語レベルの時系列データなど、臨床記録からアクセシビリティまで幅広い実世界アプリケーションに対応する機能を備えている。
重要な引用
It's not only our most capable transcription model yet, but the most capable and efficient amongst our competitors.
Our model ranks first on the FLEURS benchmark across 60 languages with an average Word-Error-Rate of 5.2%
All this performance also comes at the best price on the market, just $0.10 per hour of audio.
MAI‑Transcribe‑2 is incredibly efficient, leading the Artificial Analysis accuracy-latency Pareto frontier, combining leading transcription quality with market‑leading batch speed.
編集コメントを表示
編集コメント
マイクロソフトが発表したMAI-Transcribe-2は、単なる性能向上にとどまらず、価格破壊的な料金設定で業界の標準を再定義する可能性を秘めている。特に多言語対応と高精度な機能統合は、グローバル展開する企業の音声処理ニーズに即応した重要なステップである。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
モデル
2026 年 9 月 3 日

MAI‑Transcribe‑2 の登場です。これはマイクロソフトがこれまで開発した中で最も高性能なトランスクリプションモデルであるだけでなく、競合他社と比較しても圧倒的な能力と効率を兼ね備えています。
ダイアライゼーション(話者分離)、設定可能なトランスクリプションスタイル、単語レベルのタイムスタンプといった新機能を搭載し、Gemini 3.5 Transcribe、GPT-Transcribe、Whisper V3-Large、ScribeV2 などの主要競合モデルを凌駕。さらに、より多様な実世界の音声データにも柔軟に対応します。
FLEURS ベンチマークでは 60 か国語の平均単語誤り率(WER)が 5.2% と最高位を獲得。Artificial Analysis における精度とレイテンシのパレートフロンティアを定義し、同サイトの WER リーダーボードでも 2 位にランクイン。前世代からの性能向上をさらに加速させています。
これだけの高性能を実現しながらも、市場で最も優れた価格設定を採用。音声 1 時間あたりわずか $0.10 です。
単一モデルでより多くの課題に対応
臨床記録の作成から法的文書の整備、アクセシビリティ対応、字幕生成まで、MAI‑Transcribe‑2 は実社会での多様な用途に即した設計となっています。主な特徴は以下の通りです:
- 推論速度の大幅な向上とレイテンシの低減。特に長尺音声において顕著で、主要競合モデルと比較して最大 10 倍の高速処理を実現します。
スピーカーダイアライゼーションは、録音内の話者を区別し、発言を適切な人物に割り当てます。
単語レベルの時系列データにより、各単語の正確なタイミングが提供され、より高精度なアラインメント、検索、ナビゲーション、編集が可能になります。
キーワードバイアシング機能は、文脈だけでは識別が難しいドメイン固有の用語、略語、固有名詞などをモデルが認識するのを支援します。
設定可能なトランスクリプションスタイルにより、開発者は出力を自在に制御できます。「verbatim(逐語的)」モードでは、フィラーワードや言い直しを含む発話そのものを記録し、コンプライアンス対応や分析タスクに対応します。一方、「clean」モードではフィラーワードを除去し、読みやすい字幕、メモ、公開用トランスクリプトを生成します。
コードスイッチングは、Hinglish や Spanglish など、言語が自然に混在する会話にも対応しています。
自動言語識別機能により、事前に言語を指定する必要なく、発話されている言語を正確に検出できます。
ノイズの多い環境でも堅牢なパフォーマンスを発揮し、制御された録音環境以外でもトランスクリプションの品質を維持します。
60 以上の言語に対応しており、世界中の開発者に高品質なトランスクリプションを提供します。
精度を犠牲にしない効率性
MAI‑Transcribe‑2 は驚異的な効率性を誇り、Artificial Analysis の精度とレイテンシのパレートフロンティアをリードしています。最先端のトランスクリプション品質と市場最高クラスのバッチ処理速度を両立させました。主要競合他社の最新モデルと比較しても大幅に高速であり、低遅延でのトランスクリプションが不可欠なシーンにおいて明確な優位性を発揮します。
Artificial Analysis が実施した評価によると、このモデルは OpenAI の GPT‑Transcribe より 10 倍、ElevenLabs の Scribe v2 より 7 倍、Gemini 3.5 Transcribe より 5 倍高速でありながら、より高い精度を達成しています。
60 言語にわたる一貫した品質
MAI‑Transcribe‑2 は、他のどのモデルよりも多くの言語に対応し、高い精度を維持します。
公開されている多言語ベンチマークである FLEURS での評価では、テストされたすべての言語で常に高い精度を達成しています。複数の言語にまたがるトランスクリプションが必要な開発者は、単一のモデルを選択するだけで済み、複雑さを削減できるだけでなく、GPU リソースの最適化にも寄与します。
最高の価格で最高のパフォーマンス
高い効率性は、そのままコスト効果の高さに直結します。MAI‑Transcribe‑2 の高速性とスループットにより、市場で最も競争力のある価格設定を実現し、トランスクリプション品質を損なうことなく、より多くのオーディオデータを処理できます。ローンチ時点では、年末までの期間限定特典として 1 時間あたり 0.10 ドルで提供されます。
Build the Future With Us
私たちは、世界屈指の才能ある人材が集う、少人数で機動性の高いラボです。MAI には計算リソースに関するワクワクするロードマップがあり、その規模と速度は急速に拡大しています。また、私たちが心から信じる野心的なミッションも掲げています。
さらに、私たちのモデルを数十億人のユーザーに届け、大きな社会的インパクトを生み出すために、素晴らしいプロダクトチームとのパートナーシップにも恵まれています。
もしあなたが優秀で野心に満ちた人物であり、かつ自己中心的でない方であれば、きっとこのチームに馴染めるはずです。次世代のモデル開発に取り組む私たちと一緒に働いてください!
関連記事
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み