Hugging Face、自動運転向け世界行動モデル「SimWAM」を公開
本文の状態
日本語全文を表示中
詳細モードで約2分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
SimWAM は動画生成を学習時のみに利用し、推論時に不要な動画バックボーンを廃止することで低遅延を実現した自律走行モデルであり、NAVSIM で最高性能を達成している。
Continue in AI NEW LAB
このニュースを、実務の判断につなげる
AI NEW LABで、試したことや先に確認したい条件を共有できます。まずはログインなしで読めます。
AI NEW LABで論点を見るAI深層分析を開く2026年8月10日 17:00
AI深層分析
キーポイント
推論時の効率化アーキテクチャ
SimWAM は動画生成を学習時のシグナルとしてのみ使用し、推論時には動画ブランチを破棄して自律的なプランナーのみで動作する構造を採用している。
独立した専門家の並列学習
事前学習済み動画専門家と軽量アクション専門家を結合フローマッチングで共訓練し、両者はパラメータを共有せず統一されたアテンションインターフェースのみで相互作用する。
強化学習による報酬最適化
軌道模倣を超えた構成運転報酬に対して強化学習を適用し、単なる模倣学習以上の性能向上を図っている。
重要な引用
uses video generation purely as a training signal
video branch to be discarded after training and leaving a self-contained planner that directly predicts trajectories
achieves 91.5 PDMS on NAVSIM, surpasses state-of-the-art WAM-based planners with substantially lower latency
編集コメントを表示
編集コメント
動画生成の知識を学習時にのみ活用し、推論時には軽量なモデルで動作させるというアプローチは、実用化における遅延課題に対する有効な解決策となり得る。本研究が提示するアーキテクチャは、今後の効率的な自律走行システム開発の新たな基準となる可能性がある。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
World-Action Models (WAMs) は、動画の動的な事前知識を行動予測に転送することでエンドツーエンドの自動運転を改善しますが、既存の方法では推論時に高コストな未来生成が必要となります。私たちは SimWAM を提案します。これは動画生成をトレーニングシグナルとしてのみ使用する、シンプルかつ効果的な WAM です。
SimWAM は、事前学習済み動画エキスパートと軽量アクションエキスパートを、結合フローマッチングで共同訓練します。分離されたアテンションマスクにより、行動予測は未来のフレームに依存せず独立して行われます。これにより、トレーニング完了後に動画ブランチを破棄でき、軌道経路を直接予測する自己完結型のプランナーのみが残ります。
2 つのエキスパートはパラメータを共有しておらず、統一されたアテンションインターフェースを通じてのみ相互作用するため、学習目標や推論パイプラインを変更することなく、動画バックボーンを置き換えたり、アクションエキスパートを独立して拡張したりできます。さらに、軌道経路の模倣を超えた構成型の運転報酬を最適化するために強化学習を適用しました。
SimWAM は NAVSIM で 91.5 の PDMS を達成し、大幅に低いレイテンシで最先端の WAM ベースプランナーを上回ります。また、nuScenes へのゼロショット転送も可能です。これらの結果は、SimWAM が動画生成の進展から容易に恩恵を受け、効率的な自動運転を実現するシンプルかつ堅牢なベースラインであることを示しています。
コードとモデル重みは https://github.com/H-EmbodVis/SimWAM/ で公開されています。
原文を表示
World-Action Models (WAMs) improve end-to-end autonomous driving by transferring video dynamics priors to action prediction, but existing methods require costly future generation at inference. We present SimWAM, a simple yet effective WAM that uses video generation purely as a training signal. It co-trains a pretrained video expert and a lightweight action expert with joint flow matching. An isolated attention mask keeps action prediction independent of future frames, allowing the video branch to be discarded after training and leaving a self-contained planner that directly predicts trajectories. Since the two experts share no parameters and interact only through a unified attention interface, the video backbone could be replaced and the action expert scaled independently without modifying the learning objective or inference pipeline. We further apply reinforcement learning to optimize a compositional driving reward beyond trajectory imitation. Our SimWAM achieves 91.5 PDMS on NAVSIM, surpasses state-of-the-art WAM-based planners with substantially lower latency, and transfers zero-shot to nuScenes. These results position SimWAM as a simple yet solid baseline that could readily benefit from advances in video generation for efficient autonomous driving. The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/
関連記事
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み