Hugging Face、長期間記憶を持つ対話型世界モデル「ReWorld」を発表
本文の状態
日本語全文を表示中
詳細モードで約3分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
ReWorld は制御と記憶の構造的緊張を解決し、固定予算の KV キャッシュとランドマーク銀行を用いて長期的な視点での一貫性を維持しながら、リアルタイムで高忠実度かつ多様な世界を生成するインタラクティブ・ワールドモデルである。
AI深層分析を開く2026年8月28日 12:40
AI深層分析
キーポイント
制御と記憶の分離アーキテクチャ
学習時に制御(短期)と記憶(長期)を分離し、推論時には固定予算の下で両者を統合する構造を採用することで、構造的な緊張関係を解決している。
ランドマーク銀行による長期的記憶
ポーズにインデックスされたランドマーク銀行と固定サイズの KV キャッシュを組み合わせることで、長いロールアウトでも初期状態の再生成が可能となる。
メトリックスケール整合データエンジン
Unreal 映像、ゲーム探索、実世界映像など8つの異なるソースを物理的な動作スケールで統一し、キー操作によるカメラ移動距離を一定に保つ。
高速化された推論と高品質生成
LoRA アダプターを用いた分布マッチング蒸留によりサンプリングを4ステップに圧縮し、バックボーン1 つで高忠実度モードとリアルタイムインタラクティブモードの両方を支える。
重要な引用
The tension is structural: control wants a short horizon, memory wants an unbounded one.
At inference the whole past lives under a fixed budget: a bounded KV cache backed by a pose-indexed landmark bank.
it attains the best control fidelity (11.95^circ rotation error and the best camera-motion consistency) and the best generation quality.
編集コメントを表示
編集コメント
この論文は、インタラクティブな世界モデルにおける長期的記憶の維持という難問に対し、アーキテクチャとデータ処理の両面から具体的な解決策を示している。特に固定予算下での長期履歴再生成技術は、今後の没入型シミュレーションや自律エージェント研究にとって重要な指針となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
インタラクティブな世界モデルは、ユーザーの行動に従い、過去に訪れた場所を記憶し、リアルタイムでストリーミングする必要があります。ここには構造的な緊張関係が存在します。制御は短い時間範囲を求めますが、記憶は無限の範囲を必要とします。ReWorld はこの二つをトレーニング時に分離し、推論時にはそれぞれに制約を設けます。
各ヘッドごとのアテンションウィンドウを混合することで、ほとんどのヘッドが直近の過去に限定されつつも、少数のグローバルヘッドは履歴全体にわたって注意を向けることができます。ランダムなヘッドルーティングにより、特定の機能が特定のヘッドに固定されるのを防ぎます。また、ランダムなチャンクドロップによって、スパースな履歴データも分布内に含めるようにしています。
推論時には、過去の全情報が一定の予算枠内で管理されます。これはポーズインデックス付きランドマークバンクをバックアップとする有界な KV キャッシュであり、モデルは現在のポーズに最も近いランドマークを検索します。
メトリックスケールに整合したデータエンジンにより、8 つの異なるソース(Unreal によるフライスルー映像、ゲーム内の探索動画、実世界の撮影映像など)を物理的な動作スケールで統一しています。これにより、どのソースでも同じキー操作でカメラが同じ距離だけ移動します。また、パリンダーム軌道を用いることで、記憶トレーニングに必要な再訪の証拠を提供しています。
LoRA アダプターに限定した分布マッチング蒸留を行うことで、サンプリングを 4 ステップに圧縮しました。一つのバックボーンが、高忠実度の多ステップモードとリアルタイムインタラクティブモードの両方を担い、フォトリアリスティックな世界からゲームスタイル、そしてスタイライズされた世界まで、704x1280 の動画をストリーミングします。
3 つの軸(アクション追従、長期記憶、動画品質)を網羅するプロトコルに基づき、6 つの最近のインタラクティブ・ワールドモデルと比較した結果、本モデルは最高の制御精度(回転誤差 11.95°およびカメラ動作の一貫性において最高)と生成品質を実現しました。また、1 分間の往復ロールアウト(64 秒、384 ラテンツ)においても、固定された 12 チャンクのキャッシュが開始時の視点の再生成に成功しています。これは、スライディングウィンドウ方式では既に証拠情報が削除され尽くし、フル KV アテンションではメモリ不足で動作不能となるようなロールアウト長において達成された成果です。
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み