Google、Gemini Audio に新モデル導入し自動文字起こし機能を強化
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
The Verge AI
Google は音声制御 AI の精度向上を目的とした「Gemini 3.5 Transcribe」を発表し、自動的なフィラーワード除去や多言語対応、カスタム辞書機能を搭載した。
AI深層分析を開く2026年8月27日 02:40
AI深層分析
キーポイント
新モデルの発表と機能
Google は「Gemini 3.5 Live」「3.5 Live Experimental」「3.5 Transcribe」の新しいモデルを発表し、背景ノイズや話の中断にも強い高精度な音声認識を実現した。
フィラーワードの自動除去
Gemini 3.5 Transcribe は「um」や「ah」といったフィラーワードを自動的に検出し、編集を行う機能を提供し、自然な音声によるテキスト編集を可能にする。
カスタム辞書と専門用語対応
ユーザーは独自の語彙をモデルに提供でき、特定のスペル要件や専門用語を自動的に認識・保持させることで、手動での修正作業を削減できる。
複数話者識別とタイムスタンプ
録音された音声において最大 3 人の話者を区別し、単語レベルのタイムスタンプも付与することで、詳細な議事録作成や分析を支援する。
複数話者の特定とタイムスタンプ機能
録音済み音声において最大3人の話者を識別し、単語レベルのタイムスタンプを提供する機能を備えている。
重要な引用
Gemini 3.5 Transcribe is a completely new addition to the Gemini family
edit naturally with just your voice
remove filler words like 'um' and 'uh'
represents a major advancement from our previous transcription model, Chirp 3
編集コメントを表示
編集コメント
Gemini 3.5 Transcribe は、実務で頻出するフィラーワードの除去や専門用語の正確な認識という具体的な課題に直接応える機能であり、音声入力ワークフローの質を高める重要な一歩となる。ただし、Gemini 3.5 Pro のリリースが遅れている状況下での発表であるため、今後のモデル統合戦略への注目が求められる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Google は「Gemini Audio」を更新し、新しい Gemini 3.5 モデルを導入しました。これにより、専門用語の自動検出や 85 以上の言語への対応など、新たな文字起こし機能が追加されています。「Gemini 3.5 Live」「Gemini 3.5 Live Experimental」「Gemini 3.5 Transcribe」は、背景ノイズの影響を受けたり話しかけが中断されたりしても、Google の音声制御 AI 機能の精度を高めるために設計されています。
「Gemini 3.5 Transcribe」は Gemini ファミリーに完全な新規追加されたモデルです。その登場は、まだ Google が 6 月のリリースを約束していた Gemini 3.5 Pro モデルの発表を待っている最中というタイミングでなされました。Google は「3.5 Transcribe」について、特に多言語対応や誤訳率において、以前の文字起こしモデルである Chirp 3 と比較して大きな進歩を遂げたと述べています。
Google の新しいトランスクリプションモデルは、ユーザーが「音声だけで自然に編集」できるようになると同社は説明しています。このモデルはテキストの自動フォーマットや、「um」「uh」といったフィラーワードの削除も可能です。
ユーザーは独自の語彙をモデルに提供でき、3.5 Transcribe がスペルリングの特殊要件や専門用語に合わせてトランスクリプションを自動的に適応させることができます。これにより、これらの単語が手動で編集されるのを防ぎます。また、録音済みの音声データでは最大 3 人の話者を識別し、単語レベルの時系列情報も提供します。
Transcribe は、Gemini の音声チャットモードを支える既存の音声認識技術を基盤とした「3.5 Live」と「3.5 Live Experimental」に合わせてリリースされます。Gemini 3.5 Live は、文脈内の中断や言語認識、リアルタイムでの視覚処理への対応が強化されています。一方、Gemini 3.5 Live Experimental はさらに進んでおり、複雑なタスクの推論に取り組む際にも、その進行状況をリアルタイムで段階的にナレーションします。
これらの Gemini Audio のアップデートは、本日より英語版で macOS の Gemini アプリユーザー向けに展開されます。また、Android では特定の国と言語を対象に「Rambler」音声入力機能も提供開始となります。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み