マイクロソフト、画像・音声生成モデル「MAI」を発表
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Microsoft は自社開発の生成AIモデル「MAI-Image」および「MAI-Voice」を発表し、特にテキスト描画精度や自然言語による編集機能において大きな進歩を遂げたとした。
AI深層分析を開く2026年7月27日 02:10
AI深層分析
キーポイント
自社開発モデルの発表と特徴
Microsoft は第三者からの知識蒸留を行わず、クリーンで追跡可能なエンタープライズグレードデータを用いて訓練された「MAI-Image」および「MAI-Voice」を発表した。
テキスト描画と編集機能の革新
新モデルは画像生成におけるテキストの高精度なレンダリング能力を備え、自然言語による編集指示も理解するため、クリエイティブな反復作業が迅速かつ直感的に行える。
業界内での地位確立
WPP のグローバル最高創造責任者である Rob Reilly は、これらのモデルが Microsoft を生成 AI 分野のリーダー層に確実に位置づけたと評価している。
MAI-Image-2.5-Proの公開プレビュー開始
最高品質が求められるヒーロー画像や詳細な編集、正確なテキストレンダリング向けのモデルとして公開された。
MAI-Voice-2-Flashの公開プレビュー開始
応答性が最優先される大規模音声体験向けに設計され、既存モデルより2倍高速で32%コスト削減を実現している。
重要な引用
"MAI-Image-2.5-Pro is a strong leap forward for GenMedia tools. Beyond the impressive image quality, its ability to render text with this kind of accuracy is a real breakthrough."
"Microsoft has firmly established itself among the leaders in generative AI."
Pro is our highest-fidelity image model to date.
Flash is the fast, efficient path for high-volume voice experiences where responsiveness is everything.
編集コメントを表示
編集コメント
本記事は Microsoft が他社モデルに依存しない独自訓練モデルの成果を強調しており、生成 AI のデータソースと品質管理における同社の戦略的転換を示唆している。特にテキスト描画精度の向上は、実務利用における障壁除去として注目されるべき技術的進展である。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Copilot
Models
Superintelligence team
July 23, 2026

「MAI-Image-2.5-Pro は、生成メディアツールの大きな前進です。印象的な画像品質だけでなく、このレベルの精度でテキストをレンダリングできる点は真のブレイクスルーと言えます。また、自然言語による編集も理解するため、クリエイティブな反復作業がより迅速かつ直感的に行えます。マイクロソフトは生成 AI の分野で確固たるリーダーとしての地位を築きました」
Rob Reilly氏、WPP グローバル最高創造責任者
1 年前、マイクロソフト AI は自社専用のモデル開発に着手しました。第三者のモデルからの蒸留(ディストillation)を経ず、クリーンで追跡可能なエンタープライズグレードのデータで訓練されたモデルです。毎日マイクロソフト製品を利用する人々をサポートするために、ゼロから設計されています。
今日、これらの研究成果は、あなたがすでに信頼している製品の中で重要な役割を果たすようになっています。Build で紹介したモデルは単にベンチマークで上位を争うだけでなく、実際に本番環境で稼働し、Bing、PowerPoint、OneDrive、Dynamics 365、Azure など、拡大する Microsoft の製品ポートフォリオ全体で数百万人のユーザーに効率的な体験を提供しています。
2 つの新しいモデルバリアントの発表
実際のユースケースは一律ではありません。最高品質の忠実さを追求するクリエイティブスタジオと、毎日何百万件もの通話に対応するカスタマーセンターでは、必要なものが全く異なります。そのため、私たちは「モデルファミリー」を構築しています。各製品に、品質・速度・コストの最適なバランスを提供するためです。
本日、これらの選択肢をさらに拡大します。
- MAI-Image-2.5-Pro がパブリックプレビューを開始しました。品質が最優先されるユースケース向けです。ヒーローイメージの作成、詳細な編集、画像内テキストの正確なレンダリングに対応します。Pro はこれまでにない最高レベルの忠実度を持つ画像モデルで、100 万トークンあたりの料金は、テキスト入力で 5 ドル、画像入力で 8 ドル、画像出力で 106 ドルです。
MAI-Voice-2-Flash がパブリックプレビューを開始しました。Build 発表会で初めて紹介された Flash は、スピードとスケーラビリティを重視して設計されています。応答性が最優先される大規模な音声体験において、MAI-Voice-2 に匹敵する自然な抑揚と高音質を維持しつつ、高速かつ効率的に処理できる道筋を提供します。MAI-Voice-2 よりも 2 倍速く、コストは 32% 削減され、100 万文字あたり 15 ドルという価格設定です。
MAI-Voice-2-Flash と MAI-Image-2.5-Pro は、既存の生産環境向けモデル existing production models と並列して提供されます。これにより、開発者は品質・速度・コストのバランス曲線上で、自社の用途に最適なポイントを選択できるようになります。

Microsoft 製品向けに特化して設計されたモデル
リーダーボードはモデルの品質をベンチマークする上で有用ですが、真価を発揮するのは実際の製品でユーザーに提供される時です。Microsoft では、生産環境での採用前にすべてのモデルを厳格に評価し、最適なモデルを選定しています。その結果、MAI モデルは Microsoft の多くのプロダクト領域において、競合他社モデルを上回る品質・レイテンシ・効率性を示すようになっています。
- Bing Image Creator は現在、デフォルトで 100% 社内開発のモデルが採用されています。MAI-Image-2.5 が備える高精度な画像編集機能により、高品質な生成とより大きなクリエイティブコントロールを実現するエンドツーエンドのエンジンとして、Bing Image Creator の標準モデルに全面採用されました。
PowerPoint で利用可能な画像生成・編集機能。MAI-Image-2.5 は、PowerPoint 内で画像から画像への処理のデフォルトモデルとして稼働を開始しました。これにより、GPT-Image-2 と比較して GPU コストを最大 84% 削減しています。
OneDrive の画像編集機能では、MAI-Image-2.5 が主要な生産環境での画像編集シナリオのデフォルトモデルとなりました。導入以降、保存率は 26% 向上し、P95 レイテンシーは約 25% 短縮されました。また、中程度の負荷がかかる生産ワークロード下では、処理効率が 2.5 倍に向上しています。
コールセンターでの音声活用では、MAI-Voice-2-Flash が Dynamics 365 Contact Center の基盤として稼働しています。これは T-Mobile や EasyJet などの企業が利用する、カスタマーエージェント構築用のエンタープライズプラットフォームです。ブランドの印象を決定づける対話において、最も表現力豊かで自然な音声を届ける一方、GPU コストを最大 89% 削減しました。
MAI-Voice-2-Flash は Azure Voice Live にも統合されています。開発者は、このモデルが提供する自然で表現豊かな音声と低遅延性を活用し、Voice Live で素早く音声エージェントを構築できます。Voice Live を使えば、音声対話(スピーチ・トゥ・スピーチ)に対応する高品質なエージェントをスケーラブルに開発できる道が開かれます。
これらの改善はすべて、同じ目標に向けた一歩です。Microsoft の製品が Microsoft 製モデルによって支えられ、それらを利用する人々のために作られているという信念のもとに、私たちは前進しています。
専門家と共に構築した
医療やソフトウェア工学など、今日最も重要な課題を扱う分野では、汎用モデルだけでは不十分です。深い専門知識、緊密なフィードバックループ、そして複雑で現実的な課題を解決できるモデルが求められます。Microsoft AI はドメインの専門家と直接連携し、それぞれの独自のニーズに合わせてモデルを適応させ、洗練させています。
- MAI は、17 万人の医療従事者に利用されているソリューション「Dragon Copilot」と提携しています。同社は先四半期に 2,800 万件の患者対応を処理しました。MAI-Transcribe-1.5 は Dragon Copilot の多言語ワークフローに対応し、以前のモデルから 58 か国語をサポートする当社の最高クラスのモデルへと置き換わりました。内部評価では、多言語録音データにおいて、ほとんどの言語で文字起こしおよび言語識別のエラー率が相対的に 50% 減少しました。また初期の研究では、医療記録の精度向上においても有望な結果が得られています。
これらは決して終着点ではありません。これは一つの決断が積み重なった結果です。「自社でモデルを開発し、製品を利用する人々のためにカスタマイズできるものとし、顧客により多くの選択肢と高い価値を提供する」という決断です。
「Powered by MAI」とは、モデルごとに、製品ごとにそうであることを意味します。私たちはまだ始まったばかりです。その間、Foundry で提供されているモデルをぜひお試しください。また、Microsoft Learn で MAI-Image-2.5-Pro や MAI-Voice-2-Flash について詳しく学ぶか、MAI Playground で実際に試すこともできます。
私たちと一緒に未来を築こう
私たちは世界有数の才能ある人材が集まった、少人数で機敏に動くラボです。MAI では計算資源のロードマップも充実しており、次世代の GB200 クラスターはすでに稼働しています。そして、私たちが心から信じる野心的なミッションもあります。さらに、私たちのモデルが数十億人のユーザーに届き、大きなプラスの影響を生み出す機会を与える素晴らしいプロダクトチームとパートナーシップを結んでいることも幸運です。
あなたが優秀で野心に満ちた人物でありながら、自己主張を抑えられた方であれば、きっと私たちと相性が合うはずです。次世代のモデル開発に取り組む私たちにぜひご参加ください!
関連記事
AI算出
主要ニュースainew評価高い
記事は MAI-Image-2.5-Pro と MAI-Voice-2-Flash という具体的な新モデルの公開プレビュー開始、独自データでの訓練、および詳細な価格設定(100 万トークンあたりのドル額)を報じており、AI モデルの重大な新発表として評価できる。ただし、対象はグローバル製品であり日本固有の価格や規制情報は含まれていないため、日本の関連性は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 50
- 新規性
- 75
- 調べる価値
- 100
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み