通义驾驶模型给4B底座外挂BEV头,nuScenes检测mAP做到43.95

Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

Xin Zhou, Zongchuang Zhao, Zhibo Yang, Mingsheng Li, Humen Zhong, Shuai Bai, Du Chu, Ruizhe Chen, Zhaohai Li, Jun Tang, Qiuyue Wang, Mingkun Yang, Jiazhao Zhang, Dayiheng Liu, Dingkang Liang, Xiang Bai

cs.CV

2026-09-01

通义Qwen-Drive-1.0在4B视觉语言模型上外挂BEV感知头和规划专家,nuScenes检测mAP做到43.95,NAVSIM规划分90.7,通用视觉语言能力均分只从67.40降到66.41。

这篇在解决什么

驾驶 VLA 多半靠继续做场景问答把通用视觉语言模型扳到车上。问答能写流畅描述,并不约束三维布局、深度和占用;改得多了,座舱还要用的通用能力和指令跟随又会忘。量产车上座舱和驾驶在抢同一块算力,两个模型并立就亏了集成红利。

通义团队和华中科技大学的 Qwen-Drive-1.0 把预训练 VLM 架构原样留下,外面挂两个模块:一个 BEV 感知头,把三维检测、语义占用、BEV 地图分割变成可检查的几何输出;一个规划专家,用流匹配出未来自车轨迹。

方法

共享视觉编码器和 Qwen3.5-4B 处理多视角、多帧输入,用普通词表里的视角和帧标签标明相机与时间,问答按帧主序,规划按视角主序。BEV 头读编码器的浅层外观特征和走完 VLM 的语义特征,深度分布把前者抬到三维体素,BEV Transformer 再融成鸟瞰表征,三支解码。只训头时三维结构不够用,所以第二阶段会连视觉编码器和 VLM 一起更新,并混入通用视觉语言数据。

规划专家是 32 层、约 1.1B 的扩散 Transformer,吃 VLM 八层 grouped-query 注意力的缓存 K/V,预测 5 秒、10 Hz、50 个路点。第三阶段只训专家;第四阶段把最后三步欧拉积分改成随机策略,用组相对优势,奖励来自 NAVSIM 的 PDMS、WOD-E2E 的 Rater Feedback Score,外加位移项。规划数据约 283 万条,来自 NAVSIM、OpenScene、WOD-E2E 和 PAI-AV,其中 24.2% 带规划推理文本。

结果

感知在重映射的七类标签上评。nuScenes 上 Qwen-Drive-1.0-SFT 检测 mAP 43.95、NDS 42.83、地图 mIoU 60.99,分别比同编码器的 BEVFormerV2、BEVFormerV2、PETRv2 高 2.01 mAP、3.05 NDS、3.37 地图 mIoU。占用不是最好:nuScenes Occ mIoU 19.82,低于 BEVFormerV2 的 25.72,OpenScene 标签噪声和离线补全是论文自己点名的原因。

驾驶问答均分 69.43,比 Qwen3.5-4B 的 63.52 高 5.91 点,LingoQA 从 70.40 到 77.80,SURDS 相对提升 24.9%,Ego3D RMSE 降 40.9% 到 7.78。通用知识组均分 66.41 对底座 67.40,掉不到 1 点;空间组 53.96 对 52.99,略升。专门驾驶模型如 Alpamayo-1.5-10B 在通用组只有 14.65,对照很刺眼。

规划设置指标SFT(带推理)RL
NAVSIM PDMS越高越好88.290.7
WOD-E2E test RFS越高越好7.787.91
AlpaSim 冲出道路率越低越好24%12%

开环 WOD-E2E 验证集上 RL 把 5 秒 ADE 从 2.31 降到 1.27,测试集 ADE 几乎不动,RFS 仍升。PAI-AV 无泄漏子集上 3 秒平均 ADE 0.42 m,不如 Alpamayo-1.5 的 0.36 m,候选也更挤(minADE 0.39 对 0.17)。

为什么重要

这更像一份「驾驶座舱一体」的工程论证,而不是新规划算法。VLM 骨架不动,三维几何从外挂头读出来,通用能力掉不到 1 个点,对要在一块 SoC 上同时跑问答和开车的人是可跟的路线。规划侧的增量来自统一路点格式加奖励微调,SFT 已经能打模仿方法,RL 主要减闭环冲出道路,不是把开环误差再砍一截。

局限与存疑

占用明显弱于专用多任务检测器,作为「三维探针」只探针了检测和地图。规划推理会认错主导因果:20 米外红灯该早减速,5 米外小孩该立刻刹,两种时间尺度叠在一起时不稳定,而且轨迹不一定执行文本里写的那个立即原因。闭环 AlpaSim 上,RL 之后全事件接近遭遇仍有 41%,AlpaSim 分数 0.16,低于 Alpamayo-R1 的 0.36。PAI-AV 候选多样性不足。训练用了 Qwen3.5-Plus 改写和过滤公开驾驶问答,保留率 55.9%,过滤本身可能抬高同分布分数。

术语

原文与代码

社区讨论

相关论文

全部论文解读