Gemini 3.5 Transcribe が AI Gateway で利用可能に
本文の状態
日本語全文あり
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Vercel Blog
Google の音声認識モデル Gemini 3.5 Transcribe が AI Gateway に追加され、リアルタイムおよび完全録音の両方に対応した統合的な音声テキスト変換機能が提供されるようになった。
記事の3ポイント
AI Gateway への Gemini 3.5 Transcribe の追加
Google が提供する Gemini 3.5 Transcribe モデルが AI Gateway に正式に導入され、開発者が統一された API を経由して利用可能になった。
2 つの変種による柔軟な対応
単一リクエストで完全録音を変換する「google/gemini-3.5-transcribe」と、WebSocket 経由で進行中の音声を変換しリアルタイムで結果を返す「google/gemini-3.5-transcribe-live」の 2 つの変種が用意されている。
高度な言語検出とカスタマイズ機能
モデルは自動的に言語を検出し、85 以上の言語に対応しており、途中での言語切り替えも追跡できるほか、固有の用語やスペリングを認識させるためのカスタム辞書機能を備えている。
なぜ重要か・誰に関係するか
この発表が重要なのは、開発者が複雑な音声処理インフラを構築する代わりに、Google の高性能モデルを統一されたゲートウェイを通じて即座に利用でき、かつコスト管理やフェイルオーバー機能も同時に得られるからだ。これにより、アプリケーション開発者は音声認識機能の実装コストと運用負荷を大幅に削減し、より迅速に多言語対応の音声テキスト変換機能を製品に組み込むことができる。
背景や根拠まで確認しますか?
元記事の内容を、読みやすい日本語で続けて確認できます。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み