言語理解を世界制御へ変える「H3-World」を発表
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
H3-World は、自然言語による指示でキャラクターやカメラの動きを時間的に正確に制御する効率的なフレームワークであり、大規模動画生成モデルの能力を実用的なインタラクティブ世界制御へ変換する重要な進展である。
AI深層分析を開く2026年9月2日 15:41
AI深層分析
キーポイント
自然言語による精密制御の実現
既存の MiniMax-H3 動画生成器の粗いインターフェースを、キャラクターとカメラの指示を構造化して時間軸にアライメントさせることで、精密な世界制御へと転換する。
テンポラル・アテンション・ルーティング
各指示を意図した時間区間に制限し、アクション間の制御漏れ(コントロールリーク)を削減する「テンポラル・アテンション・ルーティング」技術を導入して精度を向上させる。
軽量な適応と汎用性
大規模事前学習で得た意味表現を直接再利用し、わずか 8,000 のゲームプレイサンプルと 10,000 ステップの LoRA 最適化で実効的な制御を実現する。
重要な引用
language is emerging as a natural interface for control
H3-World turns this coarse language interface into precise, temporally grounded world control
temporal attention routing, which restricts each instruction to its intended time interval and reduces control leakage across actions
編集コメントを表示
編集コメント
自然言語による精密な時間制御が可能になる技術は、動画生成の次のステップとして極めて重要な意味を持つ。軽量な適応手法により実用化へのハードルが下がるため、開発現場での即時的な活用が期待される。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、330 億パラメータの MiniMax-H3 動画生成器をインタラクティブな世界モデルへと変換する効率的なフレームワーク「H3-World」を発表します。私たちの重要な発見は、大規模な動画生成モデルが能力を高めるにつれ、言語が制御のための自然なインターフェースとして浮上しているという点です。
例えば MiniMax-H3 は、すでに自然言語の指示を通じてキャラクターの動作やカメラの動きをゼロショットで制御する機能を備えています。H3-World はこの粗い言語インターフェースを基盤に、専用のアクションモジュールを追加することなく、時間的に正確な世界制御を実現します。具体的には、各アクションをキャラクターとカメラの指示を組み合わせた構造化された形式で表現し、対応する時間軸の動画潜在変数(latents)と整合させます。
制御の時間精度を高めるため、私たちは「時間的アテンションルーティング」を導入しました。これにより、各指示は意図した時間区間に限定され、異なるアクション間での制御漏れが抑制されます。H3-World の特徴は、大規模な動画事前学習で獲得された意味表現をそのまま再利用し、軽量な適応だけで済む点です。
ゲームプレイのサンプル 8,000 件と LoRA 最適化ステップ 10,000 回、そしてトレーニング可能なパラメータが全体の 0.199% しかないという極めて少ないリソースで、H3-World は高い生成品質を維持しつつ、効果的なキャラクターおよびカメラ制御を実現します。また、未知のシナリオへの一般化能力も備えています。
これらの結果は、大規模動画生成モデルに内在する制御能力を、効率的にインタラクティブな世界制御へと転換できることを示しています。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み