清華大学と Qwen チーム、自動運転向けビジョン言語基盤モデル「Qwen-Drive」を公開
本文の状態
日本語全文を表示中
詳細モードで約10分の本文を読めます。
同じ出来事の情報源
この情報源を基点に整理
TLDR AI
Qwen チームは、3D 知覚、視覚質問応答、運動計画を統合した自律走行向けビジョン言語モデル「Qwen-Drive」の初期バージョンを公開し、既存の Qwen3.5 アーキテクチャに外部モジュールを追加するアプローチを示した。
AI深層分析を開く2026年9月9日 01:44
AI深層分析
キーポイント
統合アーキテクチャの採用
Qwen-Drive は事前学習済み Qwen3.5 ビジョン言語モデルを共有基盤とし、3D 知覚ヘッドとプランニングエキスパートという2つの外部モジュールを結合したユニファイドフレームワークを採用している。
BEV 知覚機能の強化
BEV 知覚ヘッドが3D オブジェクト検出、セマンティック占有予測、BEV マップ分割を同時に行い、共有表現から得られる3D情報を明示的に可視化するインターフェースを提供する。
段階的トレーニング戦略
知覚、言語、計画の各目的を統合した段階的な学習戦略を提案し、運転特化型監督と汎用ビジョン言語タスクを組み合わせてモデルを訓練している。
統合された訓練戦略とデータパイプライン
知覚、言語、計画の目的を統合した段階的訓練戦略を採用し、運転特化型監督と汎用ビジョン言語データを組み合わせる。このアプローチは、異種知覚注釈の統一、VQA回答の再注釈、複数データセットからの軌道標準化を含む統一データパイプラインによって支えられている。
計画性能における強化学習の効果
SFT(模倣学習)後の専門家にベンチマーク目標での報酬最適化を適用したRLモデルが、NAVSIMやWaymo Open Datasetなどの主要指標で高い成績を記録している。
重要な引用
Qwen-Drive-1.0 retains the architecture of the pretrained Qwen3.5 vision-language model and integrates 3D perception, visual question answering, and motion planning within a unified framework.
A BEV Perception Head jointly performs 3D object detection, semantic occupancy prediction, and BEV map segmentation.
By combining driving-specific supervision with general-purpose vision-language data, the model achieves specialized driving competence while retaining broad visual understanding and instruction-following capabilities.
RL is the same expert after reward optimization on the benchmark objectives.
編集コメントを表示
編集コメント
Qwen チームが自律走行分野へ本格的に参入し、既存の強力なビジョン言語モデルをベースに専門機能を付加する戦略を採用した点は注目すべき。このアーキテクチャは、複雑な運転タスクを単一の基盤で処理する可能性を示しており、今後の自動運転 AI の進化方向性を示唆している。
Source Article
元記事を日本語で読む
本文に関係しない購読案内、埋め込み通知、サイト内プロモーションは除いています。
自律走行向けビジョン・言語基盤モデルへの第一歩
Qwen チーム · 華中科技大学
📑 技術レポート | 📖 ブログ | 🤗 Hugging Face | 🤖 ModelScope
Qwen-Drive-1.0 の GitHub リポジトリへようこそ。ここでは Qwen-Drive に関する公式情報を確認でき、また質問や課題(Issues)を投稿することも可能です。
イントロダクション
Qwen-Drive-1.0 は、事前学習済みの Qwen3.5 ビジョン・言語モデルのアーキテクチャを継承しつつ、3D 知覚、ビジュアル質問応答(VQA)、そしてモーションプランニングを一つの統合フレームワークに組み込みました。共有される VLM としてネイティブなマルチモーダルモデル「Qwen3.5-4B」を採用し、これに2つの外部モジュールを追加しています。
- BEV 知覚ヘッド(BEV Perception Head):3D オブジェクト検出、セマンティック・オキュパンシー予測、および BEV マップ分割を同時に実行します。これは共有表現からアクセス可能な 3D 情報を探るプローブとして機能し、3D シーン構造に対する明確で検証可能なインターフェースを提供します。
- プランニングエキスパート(Planning Expert):共有 VLM の表現に基づいて条件付けを行い、将来の自車軌道(ego trajectories)を生成します。
- 元の VLM の LLM デコーダーは変更されておらず、一般的な VQA と走行関連の VQA の両方のタスクに対応可能です。
我々は、知覚・言語・計画の各目標を統合する段階的トレーニング戦略を提案します。運転に特化した監督データと汎用的なビジョン・言語データを組み合わせることで、モデルは専門的な運転能力を獲得しつつも、広範な視覚理解力や指示従順性を維持できます。このアプローチを支えるのは統一されたデータパイプラインであり、以下の機能を実装しています。(1) 多様な知覚注釈を共通のラベル空間にマッピングする、(2) 運転関連の VQA(質問応答)回答を再注釈して形式と事実に一貫性を持たせる、(3) 複数の公開運転データセットから取得した軌跡を、統一されたウェイポイント表現へ標準化する。
パフォーマンス
計画
| SFT | RL | |
|---|---|---|
| NAVSIM v1.1 navtest, PDMS | 88.2 (89.3 best-of-6) | 90.7 (91.4 best-of-6) |
| Waymo Open Dataset E2E test, RFS | 7.78 | 7.91 |
| NVIDIA PhysicalAI open-loop, minADE 3 s | 0.34 m | 0.38 m |
SFT は模倣学習によって訓練されたプランニングエキスパートです。RL は、ベンチマークの目標に対して報酬最適化を施した後の同一エキスパートです。両者は共通の VLM を共有しています。
3D 検出、オクパンシー(occupancy)、マップセグメンテーションの結果は技術報告書に、完全なプランニングテーブルはdocs/evaluation.mdに記載されています。
運転に関する VQA
| LingoQA | Ego3D RMSE ↓ | VLAD | SURDS | WaymoQA safety | WaymoQA all | CoC all | IH | |
|---|---|---|---|---|---|---|---|---|
| InternVL3.5-8B-Instruct | 46.4 | 23.01 | 54.5 | 32.8 | 54.5 | 58.1 | – | 47.5 |
| LLaVA-OV2-8B | 41.2 | 24.97 | 58.7 | 38.6 | 49.7 | 55.2 | 0.6 | 54.0 |
| Qwen3.5-4B | 70.4 | 13.17 | 65.4 | 53.0 | 62.5 | 67.1 | 2.6 | 59.0 |
| Cosmos-Reason1-7B | 45.2 | 26.71 | 33.6 | 8.5 | 39.5 | 43.9 | 3.2 | 30.5 |
| Cosmos-Reason2-8B | 59.6 | 12.62 | 56.4 | 19.5 | 57.7 | 57.9 | 1.7 | 56.0 |
| Cosmos3-nano | 65.0 | 22.41 | 57.7 | 39.7 | 56.9 | 58.4 | 4.0 | 2.0 |
| MiMo-Embodied-7B | 72.0 | 9.85 | 50.3 | 43.1 | 66.5 | 69.6 | – | 61.0 |
| Alpamayo-1.5-10B | 64.0 | 25.31 | 9.1 | 3.1 | 42.6 | 44.4 | 3.4 | 3.0 |
| Qwen-Drive-1.0-SFT | 77.8 | 7.78 | 66.5 | 66.1 | 70.7 | 74.5 | 41.3 | 71.0 |
LingoQA の評価には、公式の LingoJudge ではなく Qwen-Plus をジャッジとして採用しました。これは、公式プロトコルではシナリオ間で採点基準が緩く一貫性がないことが判明したためです。公式の LingoJudge プロトコルに基づくと、Qwen-Drive-1.0-SFT の LingoScore は 79.4 となります。– は無効または解析不能な回答を示します。
運転シーンに関する理解においては、Qwen-Drive-1.0 はベースモデルの Qwen3.5-4B を大幅に上回る性能を維持しつつ、汎用的なビジョン・言語能力も損なっていません。運転 QA と空間理解については、PAI-AV の因果連鎖(CoC)および独自開発した中国都市型運転判断セット(IH)における全体的な因果推論精度で評価されています。
一般 VQA および推論:
| MMBench | MMStar | MMMU | MMMU-Pro std | MMMU-Pro vis | CharXiv | OCRBench | RealWorldQA | SimpleVQA | CountQA | |
|---|---|---|---|---|---|---|---|---|---|---|
| InternVL3.5-8B-Instruct | 80.0 | 64.1 | 62.0 | 46.4 | 42.3 | 41.7 | 83.2 | 66.9 | 40.8 | 20.9 |
| LLaVA-OV2-8B | 82.7 | 64.9 | 54.7 | 36.3 | 26.0 | 40.1 | 79.3 | 71.8 | 36.7 | 22.6 |
| Qwen3.5-4B | 87.1 | 75.3 | 73.4 | 64.9 | 61.3 | 65.1 | 86.9 | 76.3 | 47.8 | 35.9 |
| Cosmos-Reason1-7B | 80.0 | 63.5 | 54.2 | 38.4 | 35.8 | 39.7 | 85.2 | 67.5 | 45.0 | 18.5 |
| Cosmos-Reason2-8B | 82.8 | 65.3 | 59.1 | 36.1 | 43.5 | 42.5 | 87.0 | 67.5 | 45.3 | 22.3 |
| Cosmos3-nano | 79.6 | 66.7 | 60.9 | 46.4 | 40.8 | 42.1 | 85.2 | 69.7 | 45.0 | 23.6 |
| MiMo-Embodied-7B | – | 22.4 | – | 27.4 | 28.1 | 57.5 | 78.8 | 28.5 | – | 22.6 |
| Alpamayo-1.5-10B | 7.5 | 26.1 | 27.4 | 15.6 | 13.5 | 1.5 | 3.2 | 46.9 | – | 4.7 |
| Qwen-Drive-1.0-SFT | 85.5 | 75.9 | 72.7 | 62.7 | 59.7 | 64.4 | 86.4 | 79.0 | 46.1 | 31.7 |
空間理解と位置特定:
| EmbSpatial | ERQA | RefSpatial | Omni3D | ODinW13 | |
|---|---|---|---|---|---|
| InternVL3.5-8B-Instruct | 74.2 | 42.0 | – | – | – |
| LLaVA-OV2-8B | 78.4 | 42.3 | – | – | – |
| Qwen3.5-4B | 76.0 | 46.3 | 54.5 | 47.4 | 40.8 |
| Cosmos-Reason1-7B | 68.8 | 38.5 | 0.4 | – | 4.8 |
| Cosmos-Reason2-8B | 77.6 | 43.3 | 51.8 | 32.9 | 40.2 |
| Cosmos3-nano | 77.9 | 41.3 | – | 32.3 | 35.9 |
| MiMo-Embodied-7B | 45.1 | 39.8 | 2.2 | – | – |
| Alpamayo-1.5-10B | 20.6 | 27.5 | – | – | – |
| Qwen-Drive-1.0-SFT | 78.9 | 48.5 | 50.8 | 45.8 | 45.9 |
比較実験は、ほぼ決定論的なデコードを行う同一のプロトコルで再現されています。詳細な設定については技術報告書をご覧ください。
モデル
モデルは Hugging Face または ModelScope からダウンロードできます。すべてのファイルは 1 つのディレクトリに格納されています。VLM(Vision Language Model)はルートディレクトリに配置され、すべてのタスクで共有されます。各タスク用のヘッドは、その横にあるサブフォルダに含まれています。
Qwen-Drive-1.0-4B/ 9.1 GB the VLM, which on its own serves the VQA mode
├── planner-sft/ 2.1 GB Planning Expert, imitation-trained
├── planner-rl/ 2.1 GB Planning Expert after reward optimization
└── perception/ 0.5 GB BEV perception head
VLM を読み込む際に、対応するヘッドがアタッチされます:
model = QwenDriveForPlanning.from_pretrained(
"Qwen-Drive-1.0-4B", planner="Qwen-Drive-1.0-4B/planner-rl", dtype=torch.bfloat16
)planner-rl は推論条件付きのロールアウトのみに対して報酬最適化が行われているため、推論計画モードで実行する必要があります。一方、planner-sft は直接計画と推論計画の両方をカバーしています。
インストール
メモリ 24 GB 以上の GPU の使用を推奨します。
git clone <repository-url> qwen-drive && cd qwen-drive
# Any Python virtual environment works; conda is shown here
conda create -n qwen-drive python=3.10
conda activate qwen-drive
pip install -e. --no-build-isolation # or: pip install -r requirements.txtクイックスタート
data/demo/ ディレクトリには、4 つの WOD-E2E プランニングシーンのフレームと 6 つの知覚フレームが 1 つの Parquet ファイルにまとめられています。そのため、以下のコマンドを実行する際にはモデルの重みさえあれば十分です。対象となるシーンには、信号が青に変わる夜の交差点、左折、右折、駐停車中のトラックをすり抜ける減速が含まれています。
scripts/demo.py --plot を実行すると、要約図が生成されます。この図は、左側にシーンのカメラリング(各ビューごとに 1 行、各時間ステップごとに 1 列)、右側に予測された軌道と正解データの比較、そしてその下に生成された推論プロセスを表示します。
export PYTHONPATH=src
python scripts/demo.py --model Qwen-Drive-1.0-4B --planner Qwen-Drive-1.0-4B/planner-rl \
--scenes data/demo/planning_scenes.jsonl --image-archive data/demo/frames.parquet \
--plot demo.pngimport torch
from qwen_drive import InferenceMode, QwenDriveForPlanning
from qwen_drive.benchmarks import read_scene_file
from qwen_drive.images import ImageArchive
model = QwenDriveForPlanning.from_pretrained(
"Qwen-Drive-1.0-4B",
planner="Qwen-Drive-1.0-4B/planner-rl",
dtype=torch.bfloat16,
attn_implementation="flash_attention_2",
).to("cuda").eval()
scene = next(
read_scene_file(
"data/demo/planning_scenes.jsonl",
image_archive=ImageArchive.open("data/demo/frames.parquet"),
)
).scene
result = model.run(InferenceMode.REASONING_PLANNING, scene=scene, num_samples=6)
print(result.reasoning)
print(result.trajectories.shape) # (6, 50, 3) -> (x, y, heading), 5 s at 10 Hzdocs/cookbook.md には、VQA(質問応答)、Best-of-N プランニング、ベンチマーク実行、マルチ GPU 評価、知覚推論、可視化に関するレシピが掲載されています。
ドキュメント
| ドキュメント | 目次 |
|---|---|
| docs/cookbook.md | 各推論モードおよびベンチマーク向けのレシピ |
| docs/model.md | アーキテクチャ、設定フィールド、デコーディングパラメータ |
| docs/data.md | シーンファイル形式、フレームの取得方法、フレームパッキング |
| docs/evaluation.md | ベンチマークプロトコル、メトリック定義、結果テーブル |
| docs/perception.md | 知覚設定、デモデータレイアウト、座標規約 |
リポジトリ構成
qwen-drive/
├── src/qwen_drive/ # VQA + planning: model, scenes, benchmarks, metrics
├── src/qwen_drive_perception/ # perception mode (+ CUDA kernels under ops/)
├── scripts/ # demo, prediction and scoring, visualization
├── data/demo/ # bundled demo scenes and perception frames
├── data/benchmarks/ # the four benchmark scene files (relative frame paths)
├── assets/ # figures
└── docs/
引用
本稿が有益であった場合は、以下の形式で引用してください。
@misc{zhou2026qwendrive10initialstepvisionlanguage,
title={Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving},
author={Xin Zhou and Zongchuang Zhao and Zhibo Yang and Mingsheng Li and Humen Zhong and Shuai Bai and Du Chu and Ruizhe Chen and Zhaohai Li and Jun Tang and Qiuyue Wang and Mingkun Yang and Jiazhao Zhang and Dayiheng Liu and Dingkang Liang and Xiang Bai},
year={2026},
eprint={2609.00111},
archivePrefix={arXiv},
primaryClass={cs.CV},
url={https://arxiv.org/abs/2609.00111},
}ライセンス
Qwen-Drive-1.0 は Apache 2.0 ライセンスの下で公開されています。詳細は LICENSE ファイルをご確認ください。
関連記事
News to Guide
ニュースの次に確認する
発表内容を、現在の料金や仕様と照らし合わせられる関連ガイドです。
今日のまとめ
AIデイリーブリーフで今日の重要ニュースをまとめ読み