视频生成只当训练信号,SimWAM 推理时丢弃视频分支,NAVSIM 跑出 91.5 PDMS

SimWAM: A Simple World Action Model for End-to-End Autonomous Driving

Zongchuang Zhao, Xin Zhou, Tianyang Xu, Zhengyang Sun, Kaixuan Zhou, Honglin Li, Dingkang Liang, Xiang Bai

cs.CV

2026-08-08

视频专家和动作专家联合训练,靠孤立注意力掩码解耦,推理时丢弃视频分支;单摄像头在 NAVSIM 拿 91.5 PDMS、零样本迁移 nuScenes。

这篇在解决什么

World-Action Model(世界-动作模型,简称 WAM)的思路是把视频生成的未来画面当成「想象」,再用它指导驾驶动作。问题在于,多数 WAM 规划器在推理时还得真的生成未来帧,走的是 imagine-then-act 路线,而视频扩散生成慢,放进车里的部署延迟撑不住。

方法

两个专家一起训:视频专家从一个预训练视频生成模型 Wan2.2-5B 初始化,动作专家是个轻量 DiT(隐藏维度 1024)。两者用联合 flow matching(rectified flow 同时建模轨迹和未来帧)做联合训练。关键设计是一个「孤立注意力掩码」:当前观测的隐表示同时被未来帧 token 和动作 token 看到,但未来帧 token 和动作 token 互不可见。这样动作专家只从共享的观测表征里学,不依赖任何未来帧。

训练完,视频 DiT 和未来帧解码器直接丢弃,只留下动作专家直接预测轨迹,推理时不再生成任何画面。视频与动作两个专家不共享参数,只通过注意力接口交互,所以能各自换骨干、各自调规模。

在此基础上叠了一层强化学习:用 NAVSIM 的 PDM 组合奖励,按 group-relative advantage 算优势,只在动作专家的注意力投影上挂 rank-32 LoRA,而且只挑 PDMS 低于 90 的难场景来训。

结果

配置PDMS
仅动作专家86.6
联合视频训练90.3
强化学习91.5
人类参考94.8

在 NAVSIM navtest 上,只用单前视摄像头,SimWAM 拿到 91.5 PDMS,超过 SGDrive(91.1)、ExploreVLA(90.4)、DriveWAM(90.1)、DriveLaW(89.1)。换不同视频骨干也能稳住:Wan2.1-1.3B、Wan2.2-5B、Cosmos-Predict2.5 给到的 PDMS 分别是 90.2、90.3、90.4,说明方法不绑死某个视频模型。零样本迁移到 nuScenes,平均碰撞率 0.04%(全场最低),平均 L2 误差 0.96 米。推理延迟在 384×672 分辨率、10 个采样步时约 518 毫秒(A100),因为跑的只有动作专家。

为什么重要

卖点不是刷到 SOTA 本身,而是「训练时用世界模型,推理时不需要想象」。视频生成这两年进步很快,SimWAM 把它当成一个可替换的训练信号源:换一个预训练过驾驶视频的骨干(Cosmos-Predict2.5 反而能给到 90.4),就能白拿收益,部署成本却不变。

局限与存疑

NAVSIM 是非反应式(non-reactive)规划基准,场景里其他车不会回应本车动作,这里的分数不能直接等同于真实路测。只用单前视摄像头,视野受限。强化学习只在难子集上做,增益也有限(只 +1.2 PDMS),更像打磨。91.5 离人类参考的 94.8 还差 3.3 分。

术语

原文与代码

相关论文

全部论文解读