Google、AI 音声認識モデル「Gemini 3.5 Transcribe」を発表
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Ars Technica AI
Google は音声入力処理を効率化する新モデル「Gemini 3.5 Transcribe」を発表し、既存の Chirp 3 エンジンと比較して約 70% の速度向上と誤り率の低下を実現した。
AI深層分析を開く2026年8月27日 04:35
AI深層分析
キーポイント
新モデル発表と機能
Google は「Gemini 3.5 Transcribe」を発表し、音声入力から「ums」や訂正箇所を除去して洗練されたテキストを出力する機能を備えた。
性能向上の数値
同社によると、このモデルは前世代の Chirp 3 エンジンより約 70% 高速で動作し、ライブ音声の誤り率が 5.5% に低下したとされる。
展開範囲の拡大
既に Pixel 11 の Gboard「Rambler」機能で稼働しているこのモデルは、今後は Google エコシステム全体に展開される予定である。
重要な引用
Gemini 3.5 Transcribe, an AI model designed to streamline voice input by editing out "ums" and corrections, outputting polished AI text.
The new AI model should be about 70 percent faster from voice to final transcribed text
live-speech error rate has dropped to 5.5 percent
編集コメントを表示
編集コメント
Gemini 3.5 Pro の本格展開を待たずに、特定のタスクに特化したモデルを先行リリースする戦略は実用性を重視したアプローチと言える。音声入力における速度と精度の両立は、ユーザー体験向上において極めて重要な要素であり、今後の AI エコシステムの標準化に影響を与える可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Gemini 3.5 Pro の発売を待ちながら(おそらく徒労に終わるかもしれませんが)、Google は 3.5 ブランチから別のモデルをリリースしました。同社が発表したのが「Gemini 3.5 Transcribe」で、これは音声入力における「うーん」といった間投詞や訂正部分を自動削除し、洗練されたテキストを出力する AI モデルです。
このモデルはすでに Pixel 11 の Gboard に搭載されている「Rambler」機能を支えていますが、今後は Google エコシステム全体に展開される予定です。
Google によると、Gemini 3.5 Transcribe は従来の音声認識エンジン「Chirp 3」よりもはるかに高速で高精度です。音声入力から最終的な文字起こしまでの処理速度が約 70% 向上し、リアルタイムの発話誤り率も 5.5% に低下しました。これは Chirp 3 の 7.32% よりわずかな改善ですが、音声入力中にタイポを修正するのは煩わしい作業です。そのため、この程度の向上でも大きなメリットとなります。

Credit: Google
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み