ページを読み込み中…
ページを読み込み中…
7件の記事
Mozilla AI は ACM FAccT 2026 に参加し、安全で責任ある AI 開発のための評価手法およびガードレールの取り組みについて報告した。
YC 支援企業 Interfaze は、260 億パラメータのバックボーンを凍結し、4200 万パラメータのみで訓練した拡散型 ASR モデル「diffusion-gemma-asr-small」をオープンソース化しました。このモデルは自己回帰方式ではなく並列ノイズ除去デコーダーを採用し、1 つのアダプターで 6 か国語の音声認識を可能にします。
この記事は、開発者がリアルタイムで動作する音声翻訳システムを構築するための具体的な技術的アプローチと実装手順を解説している。
Inworldは、低遅延・高表現力・多言語対応の音声生成モデル「TTS-1.5 Max」をfalプラットフォームに追加した。これにより、開発者はアシスタントやメディア体験など、本番環境でのリアルタイム音声インターフェース構築を強化できる。
Voxtralは、9言語に対応した軽量4Bパラメータのテキスト読み上げモデル「Voxtral TTS」をリリースした。このモデルは感情表現が豊かで、大規模なエージェント運用において自然で信頼性が高く、コスト効率が高いとされている。