Hugging Face、物理・空間理解統合の多モーダルモデル「Puffin-World」発表
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Hugging Face は外部モジュール不要で物理法則や空間シミュレーションを統合する多モーダルアーキテクチャ「Puffin-World」を提案した。
AI深層分析を開く2026年9月4日 15:50
AI深層分析
キーポイント
ネイティブな3次元世界状態の統合モデリング
Puffin-World は重力場や緯度などの物理、奥行きなどの幾何学、画像の外観を、外部オフラインモジュールに依存せず単一のアーキテクチャ内で同時にモデル化する。
ユニファイド・オムニカメラと物理ダイナミクスの伝播
多様なタスクや柔軟な動きに対応する「Omni-Camera」表現を導入し、未来のフレームにわたって物理的ダイナミクスを伝播させる戦略を実装している。
大規模データセット Puffin-16M の構築
複雑なシナリオへのスケーリングを目指し、1500 万組のビジョン・言語・カメラトリプルスと 100 万件の多様な動きを含む軌跡データからなる「Puffin-16M」を構築した。
オープンソース化による研究促進
コード、モデル、およびデータセットが公開され、物理的に整合性のある視覚的安定性を備えた世界生成や自己較正された世界探索などの研究を促進する。
重要な引用
We propose Puffin-World, a unified multimodal architecture that integrates physical understanding, spatial simulation, and 3D world generation and reconstruction without relying on external offline modules.
our framework jointly models three native world states: physics (gravity field and latitude), geometry (depth), and appearance (image)
we construct Puffin-16M, comprising 15 million vision-language-camera triplets and 1 million trajectories featuring various and challenging motions.
編集コメントを表示
編集コメント
外部モジュールへの依存を排除し、物理法則と視覚情報を統合的に処理するアプローチは、3D 生成技術の新たな基準を示す。公開された大規模データセットは、複雑な物理シナリオにおける研究開発を加速させる重要な基盤となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、外部のオフラインモジュールに依存することなく、物理的理解、空間シミュレーション、3D 世界の生成と再構築を統合した統一型マルチモーダルアーキテクチャ「Puffin-World」を提案します。3D 世界を確実に構築し、対話するためには、物理(重力場や緯度)、幾何学(深度)、外観(画像)という 3 つのネイティブな世界状態と、多様なタスクや柔軟な動作に対応する統一された Omni-Camera 表現を同時にモデル化する必要があります。これらの状態を記述するだけでなく、未来のフレームにわたって物理的ダイナミクスを伝播させる戦略も導入しました。絶対的なカメラ特性を実世界の基準に grounding することで、Puffin-World は物理的に整合性があり、視覚的にも安定した世界生成を実現します。さらに、外観と幾何学を単一の生成プロセス内で結合し、未来の各ビューを同時に合成しながら、その背後にある幾何構造も再構築します。この統一されたパラダイムにより、模倣や自己較正による世界探索など、複数のタスク間の連携が求められるインタリーブ型クローズドループアプリケーションが可能になります。
Puffin-World を複雑なシナリオにスケールさせるため、1500 万組のビジョン・言語・カメラのトリプルと、多様で挑戦的な動きを含む 100 万本のトラジェクトリからなる「Puffin-16M」を構築しました。この分野の研究をさらに促進するため、コード、モデル、およびデータセットを公開します。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み