ページを読み込み中…
ページを読み込み中…
6件の記事
Apple Machine Learning は、リアルおよび合成音声の誤りを学習したコンパクトなシーケンス・ツー・シーケンスモデルにより、遅延や幻覚の問題を回避しつつ音声認識の誤り訂正性能を向上させる手法を発表しました。
YC 支援企業 Interfaze は、260 億パラメータのバックボーンを凍結し、4200 万パラメータのみで訓練した拡散型 ASR モデル「diffusion-gemma-asr-small」をオープンソース化しました。このモデルは自己回帰方式ではなく並列ノイズ除去デコーダーを採用し、1 つのアダプターで 6 か国語の音声認識を可能にします。
Hugging Face は、音声エージェントが言語を混在させた(コードスイッチング)音声に対してどの程度対応可能かを評価するため、最先端の自動音声認識(ASR)技術をベンチマークした。
マイクロソフト AI は自社開発音声認識モデル「MAI-Transcribe-1.5」を発表し、43 言語・雑音環境に対応し、人工分析で WER2.4%、FLEURS 精度は業界最高水準、長音響変換速度を最大 5 倍向上させた。
Hugging Face は、Nemotron 3.5 ASR モデルを特定の言語や業界ドメイン、話者のアクセントに合わせてカスタマイズするファインチューニングの手順を解説した。
The Verge は、近年人気を集める卒業式の AI 音声アナウンスシステムが、学生の名前を誤って発音したり読み飛ばしたりする事例が多発していることを報じた。