Qwen 团队开源 Qwen-Drive-1.0-4B,一款基于 Qwen3.5-4B 构建的自动驾驶视觉语言模型。这是首个面向自动驾驶的视觉语言基础模型,在预训练阶段统一了 3D 感知与视觉问答,并进一步扩展至运动规划,同时保持预训练 VLM 的原始架构不变。

模型采用分阶段训练方案,将驾驶监督与通用视觉语言数据结合,在获得驾驶特定能力的同时,保留通用视觉理解与指令遵循能力。Qwen-Drive-1.0-4B 同时提供 SFT 和 RL 两个规划专家,官方评测覆盖 3D 感知、驾驶场景理解、通用视觉语言能力,以及开环、伪闭环和闭环运动规划。

 

模型下载:

https://modelscope.cn/models/Qwen/Qwen-Drive-1.0-4B

 

技术报告:

https://modelscope.cn/papers/2609.00111

 

GitHub:

https://github.com/QwenLM/Qwen-Drive-1.0

 

从场景感知到运动规划

同时输出三类 3D 感知结果

Qwen-Drive-1.0 的 BEV 感知头同时执行 3D 目标检测、语义占用预测和 BEV 地图分割。官方定性结果将多摄像头视角中的 3D 检测框投影回图像,并在鸟瞰视角中展示检测结果;语义占用和地图分割则分别给出预测与 Ground Truth 对照。

理解跨视角、跨时间的驾驶场景

驾驶问答不仅需要识别单帧画面,还需要结合不同摄像头视角和连续时刻判断车辆状态、空间距离与道路规则。官方给出的四组案例分别覆盖时序状态估计、规划因果推理、跨视角距离判断和车道识别。

在图示案例中,Qwen-Drive-1.0 判断连续画面的最终状态中没有停放车辆;在夜间道路施工场景中识别到前方车辆和停车标志,并给出停车决策;在跨视角距离问题中给出 22 米的判断,对应 Ground Truth 为 22.93 米;在连续道路画面中依据持续出现的左转箭头识别自车位于左转车道。图中的绿色和红色分别标记正确与错误内容。

从文字判断进一步生成行驶轨迹

官方规划案例同时展示推理文本、预测轨迹与鸟瞰视角。在开环场景中,模型分别为横穿道路的动物减速、沿右转专用车道转弯,并横向调整以绕过停止车辆;闭环案例则展示模型随红绿灯、前车和道路结构变化持续更新规划结果。

统一架构与四阶段训练

保留 Qwen3.5-4B 主体架构

Qwen-Drive-1.0 以原生多模态的 Qwen3.5-4B 为共享 VLM。视觉编码器和语言模型可以处理普通图像、单视角驾驶画面、多视角画面与多帧序列,并继续通过原有语言模型解码器回答通用和驾驶视觉问题。模型没有为驾驶任务改造 VLM 主体,而是在共享视觉语言路径之外增加两个模块:BEV 感知头从视觉编码器与 VLM 输出中提取特征,Planning Expert 则读取 VLM 的上下文表示生成未来自车轨迹。

 

 

BEV 感知头:将视觉表示显式投影到 3D 空间

BEV 感知头结合两类信息:视觉编码器提供进入 VLM 之前的外观特征,VLM 输出提供包含场景上下文的语义特征。前者经深度估计和视角变换构建 3D 体素表示,后者经特征金字塔和 BEV Transformer 汇聚到鸟瞰平面,最终由三个任务分支分别完成 3D 检测、语义占用预测和地图分割。这一模块同时是一个可检查的 3D 探针:它把共享表示中的空间信息转换成检测框、占用网格和地图元素。

Planning Expert:以 Flow Matching 生成未来 5 秒轨迹

Planning Expert 是一个 32 层扩散 Transformer,隐藏维度为 1024,参数量约 1.1B。它利用 VLM 中 8 个分组查询 Softmax Attention 层缓存的 Key 和 Value 作为条件,从高斯噪声出发,通过 Flow Matching 和 10 步 Euler 求解生成未来轨迹。

每条轨迹包含 50 个航点,覆盖未来 5 秒,频率为 10 Hz;每个航点包括自车坐标系下的纵向位置、横向位置和航向角。模型既可以直接规划,也可以先生成文字推理,再以推理和视觉上下文共同约束轨迹。

 

四阶段训练

训练分为四个阶段:第一阶段冻结视觉编码器和 VLM,只初始化 BEV 感知头;第二阶段联合训练感知头、视觉编码器和 VLM,并混合 3D 感知、驾驶 VQA 与通用视觉语言数据;第三阶段重新冻结共享 VLM,仅用 Flow Matching 训练 Planning Expert,得到 Qwen-Drive-1.0-SFT;第四阶段继续冻结共享表示,通过任务级奖励优化 Planning Expert,得到 Qwen-Drive-1.0-RL。

在数据侧,官方将不同感知数据集的标签映射到共享空间,统一驾驶问答格式,并把多个公开规划数据集转换为相同的航点表示。公开驾驶视觉语言数据经重写和一致性过滤后,由 553 万条缩减至 309 万条;第二阶段实际训练集包含 154 万条样本,并混入通用视觉语言数据以减轻领域适配带来的灾难性遗忘。

性能表现

3D 感知

官方报告显示,Qwen-Drive-1.0 在 nuScenes 上取得 43.95 mAP 和 60.99 的地图分割 mIoU,在 OpenScene 上取得 43.45 mAP 和 71.27 的地图分割 mIoU。

驾驶问答与通用视觉能力

在官方统一复现的驾驶 VQA 评测中,Qwen-Drive-1.0-SFT 在 LingoQA、Ego3D、VLAD、SURDS、WaymoQA、PAI-AV Chain-of-Causation 和内部中文驾驶决策集等项目上,相比基础模型 Qwen3.5-4B 均有提升。其中,LingoQA 在该对比表中使用 Qwen-Plus 作为评审;按照官方 LingoJudge 协议,Qwen-Drive-1.0-SFT 的 LingoScore 为 79.4。

通用视觉能力总体保持稳定,在知识、推理与识别组的 10 项设置上,Qwen-Drive-1.0-SFT 平均为 66.41,Qwen3.5-4B 为 67.40,相差 0.99 分;在空间理解与定位组的 5 项设置上,两者平均成绩分别为 53.96 和 52.99。

 

开环、伪闭环与闭环规划

Qwen-Drive-1.0-RL 在 NAVSIM v1.1 navtest 上取得 90.7 PDMS,best-of-6 为 91.4;在 WOD-E2E 测试集上取得 7.91 RFS。与 SFT 版本相比,RL 版本在 NAVSIM 和 WOD-E2E 上得分提高;在 NVIDIA PhysicalAI 的 3 秒 minADE 指标上,SFT 版本更低。

模型下载与运行

模型与代码下载

pip install -U modelscope

git clone https://github.com/QwenLM/Qwen-Drive-1.0.git qwen-drive
cd qwen-drive

modelscope download \
  --model Qwen/Qwen-Drive-1.0-4B \
  --local_dir ./Qwen-Drive-1.0-4B

模型目录结构如下:

Qwen-Drive-1.0-4B/          9.1 GB  共享 VLM,可单独用于 VQA
├── planner-sft/            2.1 GB  模仿学习后的 Planning Expert
├── planner-rl/             2.1 GB  奖励优化后的 Planning Expert
└── perception/             0.5 GB  BEV 感知头

安装依赖

conda create -n qwen-drive python=3.10
conda activate qwen-drive
pip install -e . --no-build-isolation

运行官方规划 Demo

官方仓库在 data/demo/ 中提供 4 个 WOD-E2E 规划场景及对应图像,包括夜间路口绿灯、左转、右转和经过停靠卡车时减速等场景。

export PYTHONPATH=src

python scripts/demo.py \
  --model Qwen-Drive-1.0-4B \
  --planner Qwen-Drive-1.0-4B/planner-rl \
  --scenes data/demo/planning_scenes.jsonl \
  --image-archive data/demo/frames.parquet \
  --plot demo.png

planner-sft 同时支持直接规划和推理式规划;planner-rl 只在带推理条件的 rollout 上进行奖励优化,使用时应选择 REASONING_PLANNING 模式。num_samples=6 表示从独立初始噪声批量生成 6 条候选轨迹,并不表示模型执行 6 轮推理。

驾驶场景问答

python scripts/run_vqa.py \
  --model Qwen-Drive-1.0-4B \
  --image front.jpg \
  --image front_left.jpg \
  --question "Is it safe to change into the left lane?"

3D 感知

python scripts/run_perception.py \
  --vlm Qwen-Drive-1.0-4B \
  --model Qwen-Drive-1.0-4B/perception \
  --frames data/demo/perception \
  --output outputs/perception_demo
Logo

ModelScope旨在打造下一代开源的模型即服务共享平台,为泛AI开发者提供灵活、易用、低成本的一站式模型服务产品,让模型应用更简单!

更多推荐