ページを読み込み中…
ページを読み込み中…
3件の記事
通義実験室は最新 AI 対話システム「Wan-Streamer v0.2」を発表し、音声認識からアニメーション駆動までのパイプラインを最適化することで応答遅延を約550msに短縮、微表情の読み取りや声・唇・神态の同期を実現したと報告した。
バイトゥー千帆チームは40億パラメータの文書知能モデル「Qianfan-OCR」を公開した。単一アーキテクチャで画像からマークダウンへ直接変換し、表抽出や文書QAなどを実行する。
大規模言語モデル(LLM)が自動運転車に活用できる可能性と、信頼性や課題について探る。