Qwen Blog公式発表·2025年3月27日 01:00·約1分
Qwen2.5 Omni:視覚、聴覚、会話、記述、実行をすべてこなす!
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Qwen Blog
まず要点
Qwenチームは、テキスト・画像・音声・動画を入力し、リアルタイムのテキスト生成と自然な音声合成で応答する多モーダルモデル「Qwen2.5-Omni」を公開した。このエンドツーエンドのフラッグシップモデルは、Qwen Chatで7B版を試せる。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
QWEN CHAT HUGGING FACE MODELSCOPE DASHSCOPE GITHUB PAPER DEMO DISCORD
Qwen シリーズの新たなフラッグシップエンドツーエンド多モーダルモデル「Qwen2.5-Omni」をリリースしました。包括的な多モーダル知覚のために設計され、テキスト、画像、音声、動画など多様な入力をシームレスに処理しながら、テキスト生成と自然な音声合成の両方を通じてリアルタイムストリーミング応答を提供します。最新モデルを試したい方は、Qwen Chat を訪れて「Qwen2.5-Omni-7B」をお選びください。本モデルは現在、Hugging Face、ModelScope、DashScope、GitHub でオープンに利用可能で、技術ドキュメントは論文(Paper)にて公開されています。
この記事をシェア
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み