Hugging Face、自動運転向けビジョン言語モデル「Qwen-Drive-1.0」を発表
本文の状態
日本語全文を表示中
詳細モードで約1分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
Hugging Face Daily Papers
Qwen-Drive-1.0 は、自律走行向けのビジョン言語基盤モデルへの第一歩として、3D 知覚と運動計画を統合したユニファイドフレームワークを発表する。
AI深層分析を開く2026年9月2日 15:40
AI深層分析
キーポイント
統合アーキテクチャの構築
事前学習済みビジョン言語モデル(VLM)のアーキテクチャを維持しつつ、3D 知覚、視覚的質問応答、運動計画を単一のフレームワークに統合する。
外部 BEV 知覚ヘッドの実装
外部の鳥瞰図(BEV)知覚ヘッドが3D物体検出、セマンティック占拠予測、BEVマップセグメンテーションを共同で行い、3Dシーン構造への明示的で検証可能なインターフェースを提供する。
計画専門家の機能
計画専門家(Planning Expert)が共有された VLM 表現に基づいて条件付けを行い、将来の自車軌道(ego trajectories)を生成する仕組みを持つ。
段階的トレーニング手法
運転監督と汎用ビジョン言語データを組み合わせた段階的なトレーニングレシピにより、運転固有の能力を獲得しつつ広範な視覚理解と指示従順能力を維持する。
重要な引用
We present Qwen-Drive-1.0, an initial step towards a vision-language foundation model for autonomous driving.
An external bird's-eye-view (BEV) perception head jointly performs 3D object detection, semantic occupancy prediction, and BEV map segmentation.
A Planning Expert conditions on shared VLM representations to generate future ego trajectories.
編集コメントを表示
編集コメント
この論文は、自動運転分野における多機能統合モデルの可能性を明確に示しており、従来の分割されたシステム設計に対する新たな方向性を提示している。技術的な詳細が豊富に含まれているため、実装を検討する開発者にとって重要な参照資料となるだろう。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
私たちは、自動運転のためのビジョン・ランゲージ基盤モデル(VLM)への第一歩として「Qwen-Drive-1.0」を発表します。このモデルは、事前学習済み VLM のアーキテクチャを維持しつつ、3D 知覚、視覚的質問応答、そして運動計画を一つの統合フレームワークに組み込みました。
外部の鳥瞰図(BEV)知覚ヘッドが、3D オブジェクト検出、セマンティック占拠予測、および BEV マップ分割を同時に実行します。これは共有表現からアクセス可能な 3D 情報を検証するプローブとして機能し、3D シーン構造に対する明確で検査可能なインターフェースを提供します。
プランニング・エキスパートは、共有 VLM の表現に基づいて未来の自車両軌道を生成します。
段階的なトレーニング手法により、運転に特化した能力を獲得しつつも、広範な視覚的理解や指示従順能力を維持しています。実験結果では、3D 知覚と運転シーン理解において優れた性能を示し、一般的なビジョン・ランゲージ能力の大部分も保持されていることが確認できました。
オープンループ、疑似クローズドループ、そしてクローズドループという多様な評価設定における包括的な検証により、運動計画のパフォーマンスが非常に競争力があることも明らかになりました。
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み