エージェント型二重エンジンによる物理一貫動画生成「VideoCoCo」
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
既存のテキストベースの推論に依存する動画生成モデルの物理的不整合を解消するため、実行可能なBlenderコードを思考連鎖として活用し、シミュレーションと生成を分離した「VideoCoCo」フレームワークが提案される。
AI深層分析を開く2026年8月4日 15:21
AI深層分析
キーポイント
実行可能コードによる物理的推論の実装
既存の非実行可能な中間表現に代わり、Blenderプログラムを実行可能なプロセスレベルの思考連鎖として採用し、シーンの時間発展を明示的に記述する。
エージェント型デュアルエンジンシステムの構成
コーディングエージェントがテキストプロンプトからBlenderプログラムを合成し、シミュレーションエンジンで決定論的な空間時間ドラフトを作成した後、生成エンジンがこれを写真写実的な動画に変換する。
評価ベンチマークにおける性能向上
提案された手法はPhyGenBenchで0.475から0.558へ、VBench-2.0で52.18から77.88へと大幅にスコアを向上させ、両ベンチマークで最高平均点を記録した。
ドラフト条件付き学習用データセットの構築
動画編集器がシミュレーションドラフトに適応できるよう、ドラフト・指示・ターゲットのトリプルトからなる「VideoCoCo-3K」というキュレーション済みデータセットを構築した。
重要な引用
executable Blender code serves as a process-level chain of thought
This decomposition separates process-level reasoning from high-fidelity visual realization
VideoCoCo improves the OmniWeaving baseline from 0.475 to 0.558 on PhyGenBench
編集コメントを表示
編集コメント
既存の生成モデルが抱える物理法則違反という課題に対し、コード実行を推論プロセスに組み込むというアプローチは非常に革新的である。この手法は単なる画像生成の改善を超え、シミュレーションと生成の融合による新しい動画制作のパラダイムを示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
テキストから動画を生成するモデルは、視覚的な品質において目覚ましい進歩を遂げましたが、圧縮されたテキストプロンプトから場面の時間的変化を暗黙的に推論しなければならないため、物理法則に則った動的な表現には依然として苦戦しています。既存の思考連鎖(Chain-of-Thought)アプローチは中間計画や視覚状態を導入しますが、これらの表現は通常実行不可能か、時間的な解像度が低いため、完全な時空間プロセスを具体化・制御する能力に限界があります。
この課題に対処するため、私たちは VideoCoCo を導入しました。これは、実行可能な Blender コードをプロセスレベルの思考連鎖として活用するエージェント型デュアルエンジンフレームワークです。テキストプロンプトを受け取ると、コーディングエージェントが場面の構成とその時間的変化を明示的に指定する Blender プログラムを生成します。次に、実行可能なシミュレーションエンジンがこのプログラムを実行して決定論的な時空間ドラフトを作成し、それを生成動画エンジンがドラフト条件付き編集を通じて写実的な動画へと変換します。
このアプローチにより、プロセスレベルの推論と高忠実度の視覚的実現を分離しています。また、動画エディタをシミュレーションされたドラフトに適応させるため、ドラフト・指示・ターゲットのトリプルトからなる厳選データセット「VideoCoCo-3K」を構築しました。
VideoCoCo は、PhyGenBench における OmniWeaving ベースラインを 0.475 から 0.558 に、VBench-2.0 では 52.18 から 77.88 に向上させ、両ベンチマークで最高平均スコアを達成しました。
これらの結果は、実行可能なコードが物理的に整合性のある動画生成において、効果的かつ制御可能で検証可能な中間表現として機能することを示しています。
原文を表示
Text-to-video models have achieved remarkable visual quality, yet they still struggle to generate physically consistent dynamics because the temporal evolution of a scene must be inferred implicitly from a highly compressed text prompt. Existing chain-of-thought approaches introduce intermediate plans or visual states, but these representations are typically non-executable or temporally sparse, limiting their ability to instantiate and control the complete spatiotemporal process. To address this limitation, we introduce VideoCoCo, an agentic dual-engine framework in which executable Blender code serves as a process-level chain of thought. Given a text prompt, a coding agent synthesizes a Blender program that explicitly specifies the scene and its temporal evolution. The executable simulation engine runs the program to produce a deterministic spatiotemporal draft, which is subsequently transformed into a photorealistic video by a generative video engine through draft-conditioned editing. This decomposition separates process-level reasoning from high-fidelity visual realization. To adapt the video editor to simulated drafts, we construct VideoCoCo-3K, a curated dataset of draft-instruction-target triplets. VideoCoCo improves the OmniWeaving baseline from 0.475 to 0.558 on PhyGenBench and from 52.18 to 77.88 on VBench-2.0, achieving the best average score on both benchmarks. These results demonstrate that executable code provides an effective, controllable, and inspectable intermediate representation for physically consistent video generation.
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み