コードによる世界モデル「Code World Model」を公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
既存の動画ベースの世界モデルが視覚的観察に依存する課題に対し、言語モデルの推論とコーディング能力を組み合わせる「Code World Model」を発表し、コードエージェントが世界脳として振る舞うことで持続的な状態維持を実現した。
AI深層分析を開く2026年8月28日 17:40
AI深層分析
キーポイント
世界進化と視覚実現の分離
既存モデルが視覚観察から結果を学習するのみである課題に対し、世界の状態進化を推論・コーディングで扱い、視覚的表現は別プロセスとする新しいフレームワークを導入した。
コードエージェントによる世界脳
イベントとその帰結について推論し、実行可能なコードを生成するコーディングエージェントが「世界脳」として機能し、一貫性のあるルールに従った世界進化と状態維持を実現する。
プロキシ表現による視覚化
実行可能な状態と視覚生成を接続するため、フレームごとの時空間制約を符号化する「プロキシ表現」を導入し、これをコンパイルして生成されたプロキシ動画がビデオモデルの条件として機能する。
MiniMax-H3による実証
ゲームプレイデータと実世界動画から構築したアライメント済みペアでファインチューニングしたMiniMax-H3が、コードエージェントが構築した単純なインタラクティブ世界においてプロキシに基づく時空間仕様に従いながら、豊かな視覚的詳細を維持する。
重要な引用
We introduce Code World Model, a framework that separates world evolution from visual realization by combining the reasoning and coding capabilities of language models with the generative priors of video models.
A coding agent serves as the world brain, reasoning about events and their consequences and generating executable code to maintain persistent world state and perform rule-consistent evolution.
編集コメントを表示
編集コメント
この研究は、世界モデルが単なる動画生成に留まらず、論理的な因果関係とルールを内包する「脳」として機能するための重要な一歩を示している。特にプロキシ表現という概念を用いてコードと視覚のギャップを埋める手法は、今後のオープンエンドなAIエージェント開発において注目される技術的転換点となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
世界モデルは、行動や事象によって複雑な環境がどのように進化するかをシミュレートすることを目的としていますが、既存の動画ベースの世界モデルは主に視覚的な観測からダイナミクスを学習します。しかし、視覚情報からは結果しか得られず、世界の進化を支配する根本的な知識、ルール、メカニズムまでは把握できません。このため、一貫した帰結を維持したり、整合性のあるオープンエンドな進化をサポートしたりすることが困難です。
そこで私たちは「Code World Model」を導入しました。これは、言語モデルの推論とコーディング能力に動画モデルの生成事前知識を組み合わせて、世界の進化と視覚的な実現を分離するフレームワークです。ここではコーディングエージェントが世界脳として機能し、事象とその帰結について推論しながら実行可能なコードを生成します。これにより、永続的な世界状態を維持し、ルールに則った進化を実現します。
実行可能な状態と動画生成を結びつけるために、フレームごとの時空間制約を符号化するプロキシ表現を導入しました。これをプロキシ動画にコンパイルすることで、高忠実度の視覚的観測を描画するよう動画モデルを制御します。さらに、ゲームプレイや実世界の動画から整合性のあるプロキシと観測のペアを構築するためのデータパイプラインも開発しました。
ペアされたゲームプレイデータで微調整した MiniMax-H3 は、コーディングエージェントが構築したシンプルなインタラクティブ世界において、プロキシに基づく時空間仕様に従いながら、豊かな視覚的ディテールやダイナミクスを維持します。
これらの結果は、永続的な世界の進化にコードを組み合わせることで、柔軟な視覚的実現を実現する動画モデルとの相乗効果が示唆されており、オープンエンド型の世界モデルに向けた新たな道筋を提供するものである。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み