ロボット操作向け行動条件付き動画世界モデル「DreamX-Phi 1.0」を発表
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
DreamX-Phi 1.0 は、ロボット操作のための行動条件付き動画世界モデルであり、幾何学的符号化と深さブランチを組み合わせることで物体の整合性を保ちつつ、WorldArena 2.0 チャレンジで上位の結果を出した。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月14日 13:01
AI深層分析
キーポイント
幾何学的構造の維持
PRoPE スタイルの幾何学的符号化をアテンションに注入し、各アームの SE(3) 変換を考慮することで、ロボットアームのアイデンティティと剛体運動構造を正確に保つ。
物体整合性の確保
軽量な深さブランチと SAM3 マスク、凍結された V-JEPA ティーチャーを活用し、把持中もシーンレベルの幾何学や操作対象物の整合性を維持する。
効率的な展開
分布マッチング蒸留を用いて多ステップ生成器を少数ステップの学生モデルに圧縮し、実運用における効率性を高めている。
重要な引用
a convincing rollout can still move the wrong arm or lose the manipulated object
we inject per-arm SE(3) transformations into attention via PRoPE-style geometric encoding
achieves first place on Track~1 and second place on Track~2 of the WorldArena~2.0 Challenge
編集コメントを表示
編集コメント
この技術は、単なる動画生成の精度向上にとどまらず、ロボットが物理法則を正しく理解して動作するための基盤として極めて重要である。特に幾何学的構造をモデル内部に明示的に埋め込むアプローチは、実世界での信頼性確保に向けた重要な一歩となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、ロボットの操作を目的としたアクション条件付き動画世界モデル「DreamX-Phi 1.0」を発表します。このモデルは、観測されたフレーム、言語による指示、そしてエンドエフェクタの姿勢とグリッパの状態からなる指定されたアクションシーケンスを入力として受け取り、その結果生じる未来の観測を予測します。
しかし、リアリズムだけでは忠実性が保証されません。説得力のある動画生成であっても、間違った腕を動かしたり把持した物体を失ったりする可能性があります。各腕が命令された経路に従うことを確実にするため、PRoPE スタイルの幾何学的符号化を用いてアテンションに腕ごとの SE(3) 変換を注入し、腕の同一性と剛体運動構造を保持します。
アクション制御だけでは、シーンの幾何学や把持中に生じる小さな物体の進化を完全に制約することはできません。そのため、シーンレベルの幾何学情報を扱う軽量な深度ブランチを追加し、SAM3 マスクと凍結された V-JEPA ティーチャーを用いて、把持中の一貫性を維持します。さらに、効率的な展開のために分布整合蒸馏(distribution-matching distillation)により、多ステップ生成器を少数ステップの学生モデルに蒸留しています。
執筆時点において、本モデルは WorldArena 2.0 チャレンジの Track~1 で 1 位、Track~2 で 2 位を獲得しました。当社のモデルとコードは公開予定です。
原文を表示
We present DreamX-Phi 1.0, an action-conditioned video world model for robotic manipulation that, given an observed frame, a language instruction, and a prescribed action sequence comprising end-effector poses and gripper states, predicts the resulting future observations. Yet realism alone does not guarantee faithfulness: a convincing rollout can still move the wrong arm or lose the manipulated object. To ensure the prediction respects each arm's commanded path, we inject per-arm SE(3) transformations into attention via PRoPE-style geometric encoding, preserving arm identity and rigid-motion structure. Action control alone does not fully constrain scene geometry or the evolution of small manipulated objects. We therefore add a lightweight depth branch for scene-level geometry and use SAM3 masks with a frozen V-JEPA teacher to maintain object consistency throughout grasping. We further distill the multi-step generator into a few-step student via distribution-matching distillation for efficient deployment. At the time of writing, achieves first place on Track~1 and second place on Track~2 of the WorldArena~2.0 Challenge. Our model and code will be publicly available.
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み