Hugging Face、ナビゲーション対応型オムニモーダル世界モデル「EchoWM」を公開
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
研究者らは EchoWM と呼ばれるオムニモーダル世界モデルを発表し、連続的なナビゲーションに応答しながら 720p ビデオ、環境音、音楽、音声の同時生成を実現した。
AI深層分析を開く2026年8月25日 16:41
AI深層分析
キーポイント
多様なメディアの統合生成
EchoWM は視覚(720p ビデオ)、聴覚(環境音・音楽・音声)を同時に生成し、ユーザーの連続的なナビゲーション要求に応答する能力を持つ。
視点に依存しないインタラクション
1 人称シーンでは観測者の動きを指定し、3 人称シーンではデータからカメラとキャラクターのダイナミクスを学習することで、ビュー固有のコントローラー不要な操作を実現する。
統一された軌道制御メカニズム
離散的なコマンドと連続的なポーズを共通の計量スケール相対 6DoF 軌道にマッピングし、異種データセット間でも運動の大きさを保つためのキャリブレーションを行う。
長期生成のための学習手法
音声と視覚の同時生成および軌道制御を同時に学ぶため、補完的なデータエンジンを用いて段階的トレーニングを行い、その後に自己回帰によるポストトレーニングを実施する。
重要な引用
We present EchoWM, an omnimodal world model for enterable generative media that responds to continuous navigation while jointly generating 720p video, environmental sound, music and speech.
in first-person scenes, it specifies observer motion, while in third-person scenes, camera--character dynamics are learned from data without view-specific controllers.
編集コメントを表示
編集コメント
EchoWM は、視覚と聴覚を統合し、ユーザーの動きに動的に応答する世界モデルの実現に向けた重要な一歩である。この技術は、没入型のコンテンツ制作やシミュレーション環境における新たな基準となる可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、連続的なナビゲーションに応答しながら 720p の映像、環境音、音楽、発話を同時に生成する、没入型の生成メディア向けオムニモーダル・ワールドモデル「EchoWM」を発表します。本モデルのインタラクションはカメラの意図を中心に構成されており、一人称シーンでは観測者の動きを指定し、三人称シーンでは特定の視点に依存しないコントローラーを用いてデータからカメラとキャラクターのダイナミクスを学習します。
離散的なコマンドと連続的なポーズは、共通のメトリックスケールを持つ相対的な 6-DoF 軌道に変換され、異種データ間での運動量の大きさを保つためにデータセットレベルでのキャリブレーションが行われます。音声・映像生成と軌道制御を同時に学習させるため、補完的なデータエンジンを用意し、段階的なトレーニングに続いて長期的な生成を実現する自己回帰型のポストトレーニングを採用しました。
広範な評価により、本モデルは公認のワールドモデルベンチマークにおいて優れた軌道追従性能と高い視覚品質を示すことが確認されました。多様な被写体に対応し、一人称・三人称の両方のインタラクションをサポートするとともに、長時間にわたる生成においても環境音と発話の同期を維持します。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み