Gemini 3.5 Transcribe、高精度なリアルタイム文字起こしモデル
本文の状態
日本語全文を表示中
詳細モードで約7分の本文を読めます。
同じ出来事の情報源
6媒体で確認
Vercel Blog · The Verge AI · Google DeepMind · Ars Technica AI · TLDR AI · The Decoder
各社の報じ方を比較 ↓Google は Gemini Audio チームにより、高精度かつ知的なリアルタイム文字起こしを実現する最新音声認識モデル「Gemini 3.5 Transcribe」を発表した。
AI深層分析を開く2026年8月28日 07:04
AI深層分析
キーポイント
新モデルの発表と目的
Google の Gemini Audio チームは、精密で知的なリアルタイム文字起こしを可能にする最新音声認識モデル「Gemini 3.5 Transcribe」を発表した。
開発責任者の表明
Gemini Audio エンジニアリング担当シニアディレクターの Diego Melendo Casado 氏と、同チーム首席補佐官の Luke Leonhard 氏がこの発表を主導した。
技術的特徴の強調
本モデルは単なる文字起こしを超え、「知的(intelligent)」かつ「高精度(precise)」なリアルタイム処理能力を備えていることを特徴とする。
ノイズや専門用語への対応
従来のモデルが苦手とする背景雑音、複雑な専門用語、および言い淀みの除去に優れ、生の音声から正確で整形されたテキストを直接生成する。
リアルタイムと録音の2つのAPI
双方向ストリーミングによる低遅延対応(Live API)と、話者識別や単語レベルの時系列情報を付与した録音音声処理(Interactions API)の2種類のインターフェースを提供する。
重要な引用
Our latest speech-to-text model designed for precise and intelligent real-time transcription.
Unlike conventional speech recognition models that struggle with background noise, complex jargon, and disfluency cleanup, Gemini 3.5 Transcribe converts raw audio directly into accurate, polished, formatted text.
The model can delegate complex tasks (such as image generation and file analysis) to other Gemini models via function calls.
Gemini 3.5 Transcribe's performance represents a major advancement from our previous transcription model, Chirp 3
編集コメントを表示
編集コメント
「Gemini 3.5 Transcribe」という名称は、現在の技術ロードマップとは異なる未来のバージョン番号を示唆しており、Google が音声認識分野でさらに先駆的な進化を遂げようとしている意図が窺える。この発表は、単なる機能追加ではなく、リアルタイム音声処理における「知能性」の定義そのものを更新する試みと捉えられる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
2026年8月26日
8分間の読み物
正確で知的なリアルタイム文字起こしを実現するために設計された、最新の音声認識モデルをご紹介します。
Diego Melendo Casado
Gemini Audio エンジニアリング シニアディレクター
Luke Leonhard
Gemini Audio チーフ・オブ・スタッフ(Gemini Audio チーム代表)

お使いのブラウザは音声再生に対応していません。
記事の音声を聞く
[[duration]] 分
本コンテンツは Google AI によって生成されています。生成 AI は実験的な技術です。
今日、私たちは「Gemini 3.5 Transcribe」を発表します。これは、知的な音声対話のために設計された、これまでで最も精度の高い音声認識モデルです。従来の音声認識モデルが背景ノイズや専門用語の処理、不自然な言葉の整理に苦戦する中、Gemini 3.5 Transcribe は生音声を直接、正確で洗練され、フォーマットされたテキストに変換します。
Gemini アプリや Android 端末など、当社の製品を通じて、消費者はすでに新しい音声機能「Rambler on Android」や macOS の Gemini アプリなどで、このトランスクリプションモデルの恩恵を受けています。今後は、開発者も Google AI Studio の Gemini API や Gemini Enterprise Agent Platform を活用し、同様の機能を Gemini 3.5 Transcribe で構築できるようになります。
開発ワークフローにシームレスに組み込めるよう設計された 3.5 Transcribe は、音声エージェントの構築やリアルタイム字幕ツールの作成、通話後の分析パイプラインなど、あらゆる用途に対応しています。このモデルは、2 つの異なる API を介して利用可能です。
- リアルタイムストリーミング: Live API を使用し、
gemini-3.5-transcribe-liveモデルでサブ秒単位の低遅延を実現。双方向の連続ストリーミングにより、対話型音声アプリを高速に動作させます。 - 録音済みオーディオ処理: Interactions API を使用し、
gemini-3.5-transcribeモデルで、通話ログや会議などの録音データをトランスクリプト化。話者識別と単語レベルの時系列情報を付与します。
より精度が高く、知的な文字起こしを実現
Gemini 3.5 Transcribe は、話し手の自然なスタイルを捉えるよう設計されており、意図の理解やカスタム語彙の認識に優れています。これにより、音声だけでタスクを実行することが可能になります。
- スマート文字起こし: 「火曜日に会いましょう—いや、水曜日」のような自己修正や、「えー」「あのー」といったフィラーワードを自動的に除去し、テキストを自動整形します。
- 関数呼び出し: 画像生成やファイル分析といった複雑なタスクを、他の Gemini モデルに委譲できます。現在は Gemini macOS アプリ で利用可能です。
- 高精度な文字起こし: Artificial Analysis の測定によると、ストリーミング使用では平均単語誤り率(WER)4.0%、非ストリーミング使用では 2.6% を達成しています。ノイズの多い実環境でも安定した性能を発揮し、郵便番号や注文 ID といった英数字エンティティも正確に認識します。
- カスタム語彙: 専門用語や独自のスペリングを認識するため、提供されたカスタム語彙に合わせて文字起こし内容を柔軟に適応させます。
- 多言語対応: 85 以上の言語を自動検出・文字起こしでき、地域ごとのアクセントや多様な方言にもシームレスに対応します。
- 複数話者識別: 録音済み音声において、最大 3 人の話者を正確に特定し、タイムスタンプ付きで区別します(4 人以上のサポートは実験機能です)。
Gemini 3.5 Transcribe の性能は、以前のトランスクリプションモデルである Chirp 3 と比較して大きな進歩を遂げました。新たな機能の追加、単語誤り率(WER)の改善、そして大幅なレイテンシの短縮が実現されています。
Artificial Analysis の測定によると、最終的な文字起こしまでの所要時間は 70% 向上しました。また、主要言語と地域を対象とした FLEURS ベンチマークでは、Chirp 3 を上回る精密な多言語性能を発揮し、ストリーミングモードで WER 5.50%、非ストリーミングユースケースで WER 5.04% という結果を達成しています。
スマートな文字起こしと高度な音声入力体験
Google AI Studio の Gemini API や Gemini Enterprise Agent Platform を利用するだけでなく、3.5 Transcribe は標準的な音声からテキストへの変換を超えて、Google 製品間での作業をより自然で直感的なものにします。
Gboard、Antigravity、Gemini アプリ、Chrome など、日常で使用するさまざまな場所に文脈を理解する機能を直接組み込むことで、微妙なニュアンスや意図の把握、そしてその場での編集を容易に行えるようになりました。
Android の Gboard では、新機能「Rambler」を通じて 3.5 Transcribe が話し言葉を整えられたテキストに変換し、無意味なフィラーワードを自動で削除します。音声コマンドを使って文章の編集や誤字の修正、書き方のスタイル変更も可能です。
Google Antigravity では、ユーザーの許可を得た上で画面コンテキストとチャット履歴を連携させることで、ファイル名、エージェントの思考プロセス、アクティブなドキュメントなどにおいて、極めて高精度な文字起こしを実現します。
Google AI Studio の Build モードでは、3.5 Transcribe を利用して、音声で即座にアプリのコードを書き上げることができます。
macOS 版 Gemini アプリでは、3.5 Transcribe が自然な話し言葉をきれいに整形されたテキストに変換するだけでなく、画面コンテキストとシームレスに連携する音声コマンドもサポートしています。背景で他の Gemini モデルが処理を担当することで、ローカルファイルの要約やアプリ間での文章の流用、カーソル位置での画像生成など、複雑なワークフローを音声だけで簡単に実行できます。
近日 Chrome にも対応し、ウェブ上のあらゆる入力フィールドで「話して入力」が可能になります。これにより、返信の作成や投稿の下書き、Chrome 内での Gemini プロンプト入力を、より自然に、かつ手軽に音声で行えるようになります。
早期レビューを読む
Gemini Live API を活用することで、Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel、そして Vision Agents といった開発者向けプラットフォームが、高性能な音声駆動型インターフェースの構築とデプロイを容易に実現しています。これらのプラットフォームは、裏側で複雑なリアルタイムメディアストリーミングインフラストラクチャを管理するため、開発者はユーザー体験の設計に集中できます。
また、vivo、Intellitek Health、Lingopal といった企業も Gemini 3.5 Transcribe に対して肯定的なフィードバックを発表しており、その優れたレイテンシ(遅延時間)、高い精度、そして広範な言語サポートを高く評価しています。
3.5 Transcribe を今日から使い始める
- 開発者向け: Gemini API via Google AI Studio および Google Antigravity で公開プレビューを開始しました。
- 企業向け: Gemini Enterprise Agent Platform を通じて公開プレビュー中。また、Gemini Enterprise for Customer Experience への対応も近日予定されています。
- 一般ユーザー向け: macOS の Gemini アプリで英語版が利用可能です。Android では Rambler が一部の国と言語で利用可能。Chrome への対応も近日予定されています。
同じ出来事を6媒体で確認
同じ出来事を扱う別媒体の記事です。見出しと公開時刻を比較できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み