ページを読み込み中…
ページを読み込み中…
21件の記事
Grok社が、高速で正確な音声テキスト変換と自然で表現力豊かな音声合成を提供するAPIを発表した。シンプルな価格設定と多言語対応を特徴とする。
OpenAIのChatGPT音声モードは、古くて性能の低いモデル(GPT-4o時代のモデル)で動作しており、知識カットオフは2024年4月である。
バイトダンスがSeed全双工音声大規模モデルを発表し、同社の豆包アプリに実装した。このモデルは傾聴力と耐妨害性を向上させ、対話の流暢さを12%向上させた。
Amazonが、高度な音声理解・生成モデル「Nova 2 Sonic」を発表し、コンテンツ制作者や組織が、従来の制作プロセス(企画・録音・編集)の課題を克服し、高品質な音声コンテンツを迅速に量産できるリアルタイム会話型ポッドキャスト制作を可能にした。
Claude Codeのソースコードが漏洩し、OpenAIが動画生成事業から撤退した。一方、Geminiは音楽生成機能を追加し、大規模言語モデルが推論時に学習する技術が進展している。