ページを読み込み中…
ページを読み込み中…
3件の記事
階躍は新世代音声生成モデル「StepAudio 2.5 TTS」を発表した。このモデルは、グローバル文脈制御、文中文脈制御、ゼロショット音声複製、全音色制御の3つのコア機能により、より自然で柔軟かつ表現力豊かな音声生成を実現する。
通義実験室が、映画・テレビ級の音声合成をサポートする初のマルチモーダル大規模モデル「Fun-CineForge」を発表・オープンソース化した。このモデルは、キャラクターの感情や口の動きに合わせた高品質な音声合成を実現し、AI音声合成技術の新たな進展を示している。
Together AIは、STT、LLM、TTSを一体化したインフラを提供し、DeepgramやCartesiaとのネイティブ連携により、500ms未満の低遅延でリアルタイム音声エージェントの実装を可能にする。