ページを読み込み中…
ページを読み込み中…
4件の記事
Google は Gemini Live API を公開し、オーディオ、画像、テキストの連続ストリームを処理して即時かつ人間らしい応答を提供する低遅延のリアルタイム対話機能を導入した。
Vercel は AI Gateway にオーディオ機能を追加し、OpenAI や xAI のモデルを用いてリアルタイム音声、テキスト読み上げ、音声認識を既存の API 呼び出しで利用できるようにした。この機能はベータ版として AI SDK 7 で提供されている。
xAI は音声エージェント機能の大幅な向上として、新フラッグシップ音声モデル「grok-voice-think-fast-1.0」を発表した。このモデルは、カスタマーサポートや営業などにおける複雑で曖昧なマルチステップ作業に優れ、高精度なデータ入力と大量のツール呼び出しを必要とする重要なシナリオに適している。
Mistral AIが9言語対応のテキスト読み上げモデルを発表した。同モデルは重要な音声エージェントのワークフローを支援することを目的としている。