LingBot-World-Infinity の紹介:エージェント型ハネスを備えたオープンな因果的世界モデル
本文の状態
日本語全文を表示中
詳細モードで約5分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
MarkTechPost
Ant Group の研究チームは、長期ドリフトとインタラクティブ遅延という課題に対処する因果動画生成モデル「LingBot-World-Infinity」を公開し、14B モデルと軽量版の両方を発表している。
AI深層分析を開く2026年8月1日 22:39
AI深層分析
キーポイント
因果的相互作用モデルの定義
本研究チームは、各状態が過去のフレームと現在の入力のみによって決定されるという因果性に基づき、動画生成をインタラクティブな世界シミュレーターとして定式化した。
MoBA アテンションマスクの導入
教師強制アテンションに双方向フルアテンションブロックを追加する「Mixture of Bidirectional and Autoregressive (MoBA)」を採用し、文脈が長くなることによる過学習や視覚品質の低下を防ぐ。
長期ドリフト防止のための学習手法
分布マッチング蒸留(DMD)を教師強制状態だけでなく、モデル自身の予測が生じる長期自己ロールアウト軌道上で適用し、ドリフトに対する耐性を強化した。
拡張されたアクション空間と性能
攻撃、弓術、魔法発動、射撃など幅広いアクションに対応可能となり、720p 60fps のストリーミングを駆動できる実時間軽量版も同時に提供される。
Director-Pilot Co-Simulation Framework
Vision-Language Model がマクロな因果推論を担い、Diffusion Transformer が微細な物理動態とレンダリングを行う協調フレームワークを採用している。
重要な引用
The research team formalizes this as a causal factorization: p_θ(x_1:T | a_1:T) = Π_t p_θ(x_t | x_<t, a_≤t)
As context grows, the model leans on that context instead of predicting future frames. The result is overfitting and visual quality degradation.
The student is therefore optimized on the state distribution its own predictions induce.
"A Vision-Language Model is the Director. It governs macroscopic semantic rules and causal reasoning. The Diffusion Transformer video generator is the Pilot. It simulates low-level physical dynamics and renders transitions."
編集コメントを表示
編集コメント
動画生成技術において、長期の一貫性を保ちつつインタラクティブな操作を受け付けることは長年の課題であった。本研究が提案する双方向アテンションと自己ロールアウト最適化の組み合わせは、実用的な世界シミュレーター実現への重要な一歩となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
Robbyant、アリババグループのエンボディド・インテリジェンス部門は、LingBot-World-Infinity(LingBot-World 2.0)をリリースしました。これはインタラクティブな世界シミュレーターとして振る舞う因果的動画生成モデルです。このチームが取り組む二つの失敗モードとは、長期ホライズンのドリフトとインタラクティブレイテンシです。
LingBot-World-Infinity とは何か?
インタラクティブな世界モデルは、ユーザーのアクションストリームを条件として、フレームごとに動画を生成します。各状態は過去のフレームと現在の入力のみによって決定されます。研究チームはこの仕組みを因果的因子分解として形式化しています:
p_θ(x_1:T | a_1:T) = Π_t p_θ(x_t | x_<t, a_t)
ここで、x は動画フレーム、a はアクションを表します。
インストールと実行方法
以下の手順で環境を構築し、モデルを実行できます:
pip install flash-attn --no-build-isolation
huggingface-cli download robbyant/lingbot-world-v2-14b-causal-fast \
--local-dir ./lingbot-world-v2-14b-causal-fast
提供されている generate.py は、KV キャッシングを用いて因果的推論を実行します。フレームは一度にすべて処理するのではなく、チャンクごとに処理されます。
参考となるコマンド例(8 GPU、解像度 480P):
torchrun --nproc_per_node=8 generate.py \
--task i2v-A14B --size 480*832 \
--ckpt_dir lingbot-world-v2-14b-causal-fast \
--image examples/03/image.jpg --action_path examples/03 \
--dit_fsdp --t5_fsdp --ulysses_size 8 \
--frame_num 361 --local_attn_size 18 --sink_size 6 \
--prompt "A serene lakeside scene with a lone tree standing in calm water..."
このモデルは、ユーザーのアクションに応じて因果的に動画フレームを生成し、長期にわたる一貫性を維持しながら低レイテンシでのインタラクションを実現します。
公開されたリファレンススクリプトは、8 つの GPU にわたって 480×832 の解像度で動作します。60 fps という数値は、空間時間リファイナ(spatio-temporal refiner)を通過するデプロイ済みストリームを示しています。このリファイナは復号化されたフレームをアップサンプリングし、より高いフレームレートを実現するために中間フレームを合成します。両方のステージが TensorRT エンジンにコンパイルされます。
Diffusers チェックポイントも存在します:
Copy CodeCopiedUse a different Browser
import torch
from diffusers import DiffusionPipeline
from diffusers.utils import load_image, export_to_video
pipe = DiffusionPipeline.from_pretrained(
"robbyant/lingbot-world-v2-14b-causal-fast",
dtype=torch.bfloat16, device_map="cuda")
frames = pipe(image=load_image("seed.png"), prompt="...").frames[0]
export_to_video(frames, "output.mp4")
ホストされたパスでは、Reactor がモデルを reactor/lingbot-world-2 として提供しています。そのドキュメントには、1664×960 で 48 fps の性能が記載されています。セッションはコマンド駆動型かつ状態保持型です:
Copy CodeCopiedUse a different Browser
from reactor_sdk import Reactor, ReactorStatus
reactor = Reactor(model_name="reactor/lingbot-world-2", api_key=KEY)
@reactor.on_status(ReactorStatus.READY)
async def on_ready(status):
ref = await reactor.upload_file("seed.jpg")
await reactor.send_command("set_image", {"image": ref})
await reactor.send_command("set_prompt", {"prompt": "A misty alpine valley."})
await reactor.send_command("start", {})
動きはパルスではなく、永続的な状態です。set_move_longitudinal コマンドで「forward」を指定すると、「idle」を送信するまで駆動し続けます。コマンドは次のチャンク境界で処理されます。
Comparison
研究論文における比較は定性的なものです。すべての優位性に関する主張は、並列配置されたフレームグリッドに基づいています。
PropertyM-G 3.0D-WLingBot-WorldHappyOysterGenie 3LingBot-World-Infinity
生成時間:分・分・分・分・分・時間(無限)
意味的相互作用:なし・なし・なし・少数・少数・無限
ドメイン:ゲーム・一般・一般・一般・一般・一般
動的度合い:中程度・中程度・高・中程度・中程度・高
リアルタイム対応:あり・あり・あり・あり・あり・あり
オープンソース:あり・あり・なし・なし・あり
ユースケース
ゲームおよびレベルのプロトタイピング:運河の町の画像をシードとして与え、プロンプトをホットスワップして吹雪を召喚します。アセットパイプラインが存在する前に、雰囲気について反復検討できます。
具身シミュレーション:スクリプト化されたカメラポーズの下でファーストパーソンロールアウトを生成し、Unreal Engine シーンを作成することなく、フレームをポリシー学習器に供給します。
ビデオ理解のための合成データ:チャンクごとのプロンプトが時間的に局在化したイベントを生成します。各チャンクは構造上、独自のキャプションを持ちます。
エージェント評価ハッチ(harness):ディレクターエージェントにイベントを提案させ、その後続するエージェントの反応をスコアリングします。論文自体のアナロジーは、Codex などのコードスケフォールドです。
プレビジュアライゼーション:Directed agent camera moves を実行するために set_camera_pose を駆動し、参照画像を失うことなく世界中をストリーミング中にリスタイルします。
キーポイント
LingBot-World-Infinity(LingBot-World 2.0)は、Robbyant が公開した因果的世界モデルであり、1 つの 14B チェックポイントと共にリリースされました。
MoBA アテンション(attention)と自己ロールアウト上の DMD(DMD)が真の貢献です。これは長期的なドリフトを直接対象としています。
ディレクター(VLM)とパイロット(DiT generator)のハルネスにより、フレーム予測器がインタラクティブなシミュレーターへと変換されます。
720p/60 fps の主要機能には未公開のデプロイメントスタックが必要ですが、公開スクリプトでは 8 枚の GPU を用いて 480×832 で動作します。
比較は定性的なものであり、1 つの 60 分間のロールアウトのみを対象とし、VBench や FVD は使用せず、非商用の CC BY-NC-SA 4.0 ライセンスが適用されます。
インタラクティブ・エクスペラナー
注記:本記事のリーダーシップとリソースを提供いただいた Ant Research チームに感謝いたします。Ant Research チームは、このコンテンツ/記事のプロモーションをサポートしています。
「Meet LingBot-World-Infinity: An Open Causal World Model With An Agentic Harness」という投稿は、MarkTechPost で最初に公開されました。
AI算出
主要ニュースainew評価標準
AI モデルの核心技術(因果的動画生成、エージェント型ハネス)と実装詳細が明記されており、新規性の高い主要な技術発表として評価できる。ただし、日本企業との直接的な関わりや日本語圏特有の情報はないため、日本の関連性は低めとなる。
6つの評価軸を見る
- AI関連度
- 100
- 情報源の信頼性
- 25
- 新規性
- 75
- 調べる価値
- 75
- 重複の少なさ
- 100
- 日本での有用性
- 25
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み