ページを読み込み中…
ページを読み込み中…
3件の記事
通義实验室は音声認識大模型「Fun-ASR1.5」をリリースした。同モデルは30言語と7大方言を単一アーキテクチャで処理し、典型方言の誤り率を56%削減して工業級の実用化を実現した。
研究者らが、アラビア語大規模言語モデル(LLM)のエミレーツ方言理解能力を評価するための堅牢なベンチマーク「Alyah」を開発した。
アリババのQwenチームは、API経由で公開された最新バージョン「Qwen-TTS」について発表した。数百万時間分のデータで学習したこのモデルは、人間のレベルの自然な発話を実現し、入力テキストに応じて抑揚や感情を自動調整する。さらに北京語、上海語、四川語の3つの中国方言に対応している。