Anthropic、物理言語を基盤とした世界モデル「PhiZero」を発表
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Hugging Face Daily Papers は、物理言語を用いて世界状態の遷移を明示的に推論し、その後映像を生成する PhiZero という新しい物理世界モデルを発表した。
AI深層分析を開く2026年8月4日 15:19
AI深層分析
キーポイント
物理言語による推論とレンダリングのパラダイム
既存のモデルがピクセル空間で直接未来を予測するのに対し、PhiZero はまず物理言語シーケンスとして世界の変化を推論し、その後映像へ変換する「推論後レンダリング」を採用している。
自己教師あり学習による物理言語の獲得
自然な言語で予測構造を抽象化・整理する人間の能力に着想を得て、野外動画から自己教師あり学習により物理言語を獲得し、物理世界の進化について明示的に推論させる。
多様なベンチマークでの性能検証
生成と理解の両方のベンチマークで広範な実験が行われ、物理的に整合性のある世界進化をモデル化する能力が実証された。
重要な引用
We introduce PhiZero, a physical world model built around physical language
PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos.
Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution.
編集コメントを表示
編集コメント
この研究は、AI が世界を理解する際に「言語による推論」という中間ステップを挟むことで、単なる映像予測を超えた物理的整合性を獲得できる可能性を示している。今後の世界モデル開発において、視覚情報だけでなく構造化された言語表現をどう活用するかという新たな潮流を形成する重要な一歩となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、物理言語を中心とした世界モデル「PhiZero」を発表します。物理言語とは、世界の状態遷移を表現するコンパクトな離散表現です。
既存の物理世界モデルは、通常、未来の動画をピクセル空間で直接予測しますが、これでは高次元の視覚予測器の中に隠れたままとなる根本的な世界のダイナミクスを扱っています。人間が視覚経験から予測構造を抽象化し、それを自然言語に整理して明示的に推論できる能力に触発され、私たちは野外動画を通じて自己教師あり学習で物理言語を獲得しました。そして、この言語を用いて物理世界がどのように進化するかを明示的に推論します。
これにより、PhiZero は「推論してから描画する」というパラダイムを採用しています。まず未来の世界の進化を物理言語のシーケンスとして推論し、次にその推論された遷移を描画して動画に変換します。
生成と理解に関する広範なベンチマークでの実験により、PhiZero が物理的に整合性のある世界進化をモデル化する能力が実証されました。さらに、現実的でインタラクティブな世界モデリング、微細な動作条件付きシミュレーション、ゼロショットモーション転送におけるその可能性も示しています。
原文を表示
We introduce PhiZero, a physical world model built around physical language, a compact discrete representation of world-state transitions. Existing physical world models typically predict future videos directly in pixel space, leaving the underlying world dynamics implicit within high-dimensional visual predictors. Motivated by humans' ability to abstract predictive structure from visual experience and organize it in natural language for explicit reasoning, we learn physical language from in-the-wild videos through self-supervision and use it to explicitly reason about how the physical world evolves. Accordingly, PhiZero adopts a reason-then-render paradigm: it first infers future world evolution as a physical-language sequence and then renders the inferred transitions into videos. Extensive experiments across generation and understanding benchmarks validate the ability of PhiZero to model physically coherent world evolution. We further show its potential for realistic and interactive world modeling, fine-grained action-conditioned simulation, and zero-shot motion transfer.
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み