Google DeepMind、Gemini 3.5 Transcribe を公開
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Google DeepMind
Google DeepMind は 2026 年 8 月 26 日、精密かつインテリジェントなリアルタイム文字起こしを目的とした最新音声認識モデル「Gemini 3.5 Transcribe」の発表を行った。
AI深層分析を開く2026年8月27日 02:51
AI深層分析
キーポイント
新モデルの発表と目的
Google DeepMind は精密でインテリジェントなリアルタイム文字起こしを実現する最新音声認識モデル「Gemini 3.5 Transcribe」を発表した。
発表者の所属と役割
この発表は Gemini Audio エンジニアリングシニアディレクターの Diego Melendo Casado と、同チームに代わって首席スタッフオフィサーを務める Luke Leonhard によって行われた。
技術的特徴の概要
本モデルはリアルタイム処理に最適化されており、高精度な文字起こしとインテリジェントな機能提供を主眼としている。
ノイズや専門用語への対応
従来の音声認識モデルが苦手とする背景雑音、複雑な専門用語、不自然な発話の整理を直接処理し、正確で整えられたテキストに変換する。
リアルタイムと録音データの両方に対応
ライブ API を用いたサブ秒単位の双方向ストリーミングと、インタラクション API を用いた話者識別や単語レベルのタイムスタンプ付き録音処理の 2 つの API で提供される。
重要な引用
Our latest speech-to-text model designed for precise and intelligent real-time transcription.
Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text.
Gemini 3.5 Transcribe is designed to capture your natural speaking style to better understand your intent and recognize custom vocabulary, so you can execute tasks with your voice.
As measured by Artificial Analysis, time to final transcription, for example, improves by 70%.
編集コメントを表示
編集コメント
2026 年という未来の日付で発表されたニュースは、同社のロードマップや将来の技術展望を示唆している。Gemini シリーズが音声処理領域でも進化を続けている点は注目される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
2026年8月26日
8分間の読み物
正確で知的なリアルタイム文字起こしを実現するために設計された、最新の音声テキスト変換モデルをご紹介します。
Diego Melendo Casado
Gemini Audio エンジニアリング シニアディレクター
Luke Leonhard
Gemini Audio チーフオブスタッフ(Gemini Audio チーム代表)

お使いのブラウザは音声再生要素に対応していません。
記事の音声を聞く
[[duration]] 分
このコンテンツは Google AI によって生成されています。生成 AI は実験的な技術です。
今日、私たちは「Gemini 3.5 Transcribe」を発表します。これは、知的な音声対話のために設計された、これまでで最も精度の高い音声テキスト変換モデルです。従来の音声認識モデルが背景ノイズや専門用語の難解さ、また話し言葉の不自然さを処理することに苦労する中、Gemini 3.5 Transcribe は生音声をそのまま読み取り、正確で洗練され、フォーマットされたテキストへと直接変換します。
Gemini アプリや Android 端末など、当社の製品を通じて、消費者はすでにこの音声トランスクリプションモデルの恩恵を受けています。具体的には、Android の「Rambler」機能や macOS 版 Gemini アプリで提供される新しい音声機能がその一例です。
開発者は今、Google AI Studio の Gemini API や Gemini Enterprise Agent Platform を利用して、同様の機能を Gemini 3.5 Transcribe で構築できるようになりました。
Gemini 3.5 Transcribe は、音声エージェントの構築やリアルタイム字幕ツールの開発、通話後の分析パイプラインの作成など、あらゆる開発ワークフローにシームレスに組み込めるよう設計されています。このモデルは、2 つの異なる API を通じて利用可能です。
- リアルタイムストリーミング: Live API を使用し、
gemini-3.5-transcribe-liveモデルでサブ秒単位の低遅延を実現。双方向の連続ストリーミングにより、対話型音声アプリを高速に動作させます。 - 録音済みオーディオ処理: Interactions API を使用し、
gemini-3.5-transcribeモデルで会議や通話ログなどの録音データをトランスクリプションします。話者識別と単語レベルの時系列情報を付与可能です。
より精密で賢い文字起こしを実現
Gemini 3.5 Transcribe は、話し手の自然なスタイルを捉えるように設計されており、意図の理解やカスタム語彙の認識を向上させることで、音声によるタスク実行を可能にします。
- スマート文字起こし: 「火曜日に会いましょう—いや、水曜日」のような自己修正や、「えー」「あのー」といったフィラーワードを自動的に除去し、テキストを自動整形します。
- 関数呼び出し: 画像生成やファイル分析といった複雑なタスクを、他の Gemini モデルに委譲できます。現在、Gemini macOS アプリで利用可能です。
- より精密な文字起こし: Artificial Analysis の測定によると、ストリーミング利用では平均単語誤り率(WER)4.0%、非ストリーミング利用では 2.6% を達成しています。ノイズの多い実環境でも高い性能を発揮し、郵便番号や注文 ID などの英数字エンティティも正確に捉えます。
- カスタム語彙: 専門用語や独自のスペルを認識し、提供されたカスタム語彙に合わせて文字起こし結果をシームレスに適応させます。
- 多言語対応: 85 以上の言語を自動的に検出し、地域ごとのアクセントや多様な方言にも柔軟に対応して文字起こしを行います。
- 複数話者識別: 録音済みの音声において、最大 3 人の話者を正確に特定し、各発言のタイムスタンプを表示します(3 人以上の対応は実験的機能です)。
Gemini 3.5 Transcribe の性能は、以前のトランスクリプションモデルである Chirp 3 から大きく進化したもので、新機能の追加、単語誤り率(WER)の改善、そして大幅なレイテンシの短縮を実現しています。Artificial Analysis の測定によると、最終的な文字起こしまでの所要時間は 70% 向上しました。
主要言語とロケールを対象とした FLEURS ベンチマークでは、Chirp 3 を上回る高精度な多言語パフォーマンスを発揮し、ストリーミングモードで WER 5.50%、非ストリーミングユースケースで WER 5.04% という結果を達成しています。
スマートトランスクリプションと高度な音声入力体験
Google AI Studio の Gemini API や Gemini Enterprise Agent Platform を活用するだけでなく、3.5 Transcribe は標準的な音声文字変換の枠を超え、Google 製品間での作業をより自然で直感的なものにします。Gboard、Antigravity、Gemini アプリ、Chrome など、日々の利用シーンに文脈を理解する機能を直接組み込むことで、微妙なニュアンスや意図、その場での編集を容易に捉えることが可能になります。
Android の Gboard では、新機能「Rambler」を通じて 3.5 Transcribe が話した思考を整形式のテキストに変換し、 filler words(つなぎ言葉)を自動で除去します。音声コマンドを使って編集を行ったり、スペルミスを修正したり、文章のスタイルを変更することも可能です。
Google Antigravity では、ユーザーの許可を得た上で画面の文脈やチャット履歴と連携し、ファイル名、エージェントの思考内容、アクティブなドキュメントにわたる高精度な文字起こしを実現します。
Google AI Studio の Build モードでは、3.5 Transcribe を利用して、音声で即座にコードを生成しながらアプリ開発を進めることができます。
macOS 版 Gemini アプリでは、3.5 Transcribe が自然な発話をきれいに整形されたテキストに変換するだけでなく、画面の文脈とシームレスに連携する音声コマンドもサポートします。背景で他の Gemini モデルが処理を担当するため、ローカルファイルの要約や、アプリ間での文章の流用、カーソル位置での画像生成など、複雑なワークフローを音声だけで手軽に実行できます。
近日中に Chrome にも対応し、ウェブ上のあらゆる入力フィールドで「話して入力」が可能になります。これにより、返信の作成や投稿の下書き、Chrome 内での Gemini への自然な指示出しなどを、音声でより直感的かつ簡単にできるようになります。
初期レビューを読む
Gemini Live API を活用することで、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、Vision Agents といった開発者向けプラットフォームが、高性能な音声駆動型インターフェースの構築と展開を容易に実現しています。これらのプラットフォームは、裏側で複雑なリアルタイムメディアストリーミングインフラストラクチャを管理し、開発者はユーザー体験の設計に集中できます。
Vivo、Intellitek Health、Lingopal といった企業も、3.5 Transcribe の優れたレイテンシ、精度、多言語対応について肯定的なフィードバックを提供しています。
3.5 Transcribe を今日から使い始める
- 開発者向け: Gemini API via Google AI Studio および Google Antigravity で公開プレビューを開始しました。
- 企業向け: Gemini Enterprise Agent Platform を通じて公開プレビュー中。また、Gemini Enterprise for Customer Experience への展開も近日予定されています。
- 一般ユーザー向け: macOS の Gemini アプリで英語版が利用可能です。Android では Rambler が一部の国と言語 で利用可能で、Chrome への対応も近日予定されています。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み