Qwen2.5 Omni:視覚、聴覚、会話、記述、実行をすべてこなす!
Qwenチームは、テキスト・画像・音声・動画を入力し、リアルタイムのテキスト生成と自然な音声合成で応答する多モーダルモデル「Qwen2.5-Omni」を公開した。このエンドツーエンドのフラッグシップモデルは、Qwen Chatで7B版を試せる。
QWEN CHAT HUGGING FACE MODELSCOPE DASHSCOPE GITHUB PAPER DEMO DISCORD
Qwen シリーズの新たなフラッグシップエンドツーエンド多モーダルモデル「Qwen2.5-Omni」をリリースしました。包括的な多モーダル知覚のために設計され、テキスト、画像、音声、動画など多様な入力をシームレスに処理しながら、テキスト生成と自然な音声合成の両方を通じてリアルタイムストリーミング応答を提供します。最新モデルを試したい方は、Qwen Chat を訪れて「Qwen2.5-Omni-7B」をお選びください。本モデルは現在、Hugging Face、ModelScope、DashScope、GitHub でオープンに利用可能で、技術ドキュメントは論文(Paper)にて公開されています。
原文を表示
QWEN CHAT HUGGING FACE MODELSCOPE DASHSCOPE GITHUB PAPER DEMO DISCORD
We release Qwen2.5-Omni, the new flagship end-to-end multimodal model in the Qwen series. Designed for comprehensive multimodal perception, it seamlessly processes diverse inputs including text, images, audio, and video, while delivering real-time streaming responses through both text generation and natural speech synthesis. To try the latest model, feel free to visit Qwen Chat and choose Qwen2.5-Omni-7B. The model is now openly available on Hugging Face, ModelScope, DashScope,and GitHub, with technical documentation available in our Paper.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み