Google、Gemini 3.5 Transcribe を発表し85言語対応とリアルタイム誤り修正を実現
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The Decoder
Google は新モデル Gemini 3.5 Transcribe を発表し、85言語対応とリアルタイムでの誤り修正機能を搭載して、前世代比で遅延を70%削減した。
AI深層分析を開く2026年8月27日 20:15
AI深層分析
キーポイント
多言語・高精度な音声認識の実現
Gemini 3.5 Transcribe は85以上の言語に対応し、ストリーミングモードでの単語誤り率(WER)を4.0%に抑える。
リアルタイムの自己修正機能
このモデルは発話中のつまずきやフィラーワードを自動的に除去・補正し、自然なテキストへ変換する機能を備えている。
性能と遅延の劇的な改善
前世代の Chirp 3 と比較して遅延が70%低下し、リアルタイム処理における応答速度が大幅に向上した。
他モデルとの連携機能
ファンクションコール機能を介して、他の Gemini モデルへタスクをハンドオフする柔軟なアーキテクチャを採用している。
重要な引用
Google's new Gemini 3.5 Transcribe recognizes over 85 languages, strips filler words, and corrects slips of the tongue in real time.
It hits a 4.0 percent word error rate in streaming mode, with 70 percent lower latency than its predecessor, Chirp 3.
編集コメントを表示
編集コメント
Gemini 3.5 Transcribe は、音声認識のボトルネックであった遅延と誤り率を同時に解決した画期的なアップデートである。特に多言語対応と自己修正機能は、グローバルなリアルタイム通訳や会議システムへの応用可能性を大きく広げる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。

Google の新モデル「Gemini 3.5 Transcribe」は、85 以上の言語に対応し、実時間で不要なフィラーワード(言い淀み)を除去しながら、話者のつまずきを自動修正します。ストリーミングモードでの単語誤り率は 4.0% に抑えられ、前世代の「Chirp 3」と比較して遅延が 70% 削減されました。また、関数呼び出し(function calling)を通じて他の Gemini モデルへタスクを委譲することも可能です。
この記事は The Decoder で最初に公開されたものです。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み