Google、85 言語以上対応の音声認識モデル「Gemini 3.5 Transcribe」を公開
本文の状態
日本語全文あり
詳細モードで約6分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
Gemini 3.5 Transcribe は、事前録音ファイル用(Interactions API)と双方向ストリーミング用(Live API)の 2 つのエンドポイントとして提供され、機能セットや制限、価格が異なる。
記事の3ポイント
双構成 API の分離
Gemini 3.5 Transcribe は、事前録音ファイル用(Interactions API)と双方向ストリーミング用(Live API)の 2 つのエンドポイントとして提供され、機能セットや制限、価格が異なる。
高精度な認識性能
Artificial Analysis による測定で、非ストリーミング時の平均単語誤り率(WER)は 2.6%、ストリーミング時は 4.0% を記録し、前モデル Chirp 3 より最終転写までの時間が 70% 短縮された。
多言語とコードスイッチング対応
自動検出機能は 85 カ国以上に対応しており、文脈内の言語切り替え(code-switching)も自動的に処理可能である。
なぜ重要か・誰に関係するか
この発表が重要なのは、Google が音声認識モデルを用途別に明確に分割し、それぞれ異なる機能制限と価格体系を持つ管理型サービスとして提供することで、開発者が実装設計を慎重に行う必要がある点を示しているからだ。この変化は、リアルタイム通訳や会議記録システムを開発するエンジニアおよび企業の AI 導入担当者に影響を与え、それぞれのユースケースに最適なエンドポイントを選択し、API の制限事項を確認するよう求める。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み