ページを読み込み中…
ページを読み込み中…
12件の記事
開発チームは、アラビア語大規模言語モデルの性能を品質基準で評価するリーダーボード「QIMMA」を公開した。同ボードは、モデルの正確性と信頼性を最優先し、アラビア語処理能力を比較する。
研究者が合成データを活用して、高速で多言語対応の光学文字認識(OCR)モデルを開発した。この手法は、従来のデータ収集の課題を克服し、複数言語でのテキスト認識の効率化を実現している。
通義実験室が主催したイベントで、5人の開発者がAIを活用した実例を紹介した。具体的には、AIによる病歴管理ツール開発、農業育種への応用、多言語対応モデル「SEA-LION」、障がい者のコミュニケーション支援、高齢者向けAI教育など、多様な分野での実践事例が示された。
マイクロソフトがMAI-Transcribe-1を発表した。このモデルは、25言語で背景ノイズがあっても正確に音声をテキストに変換し、前モデルより2.5倍高速で1時間あたり0.36ドルのコストで動作する。マイクロソフトは既に自社製品でこのモデルを使用している。
Google AIチームは、24のアフリカ語に対応するオープン音声データセット「WAXAL」を公開し、低リソース言語の音声認識・合成モデル学習データを補完した。