驾驶世界模型反事实预测名不副实,搬证据让事件恢复率 0.3 拉到 0.7

How Can Driving World Models Do Counterfactual Prediction?

Jiaru Zhang, Can Cui, Yi Xu, Xin Ye, Ruqi Zhang, Ziran Wang

cs.CV

2026-08-12

直预测只用历史和替代动作、丢掉「后来真发生了什么」,因此漏掉事件;把事实片段搬进反事实视角,恢复率从约 0.3 升到 0.7。

这篇在解决什么

很多驾驶世界模型(Vista、Drive-WM,以及 Waymo、Google DeepMind 的工业模型)宣称能做反事实预测:给一段真实驾驶录像,问「要是自车当时加速或急刹会怎样」,模型吐出一段视频。业界默认只要喂进去一个替代动作就够了。

这篇指出这个默认做法有根本缺陷。所谓反事实,问的是「在这个已经发生的特定场景里,换一个动作会怎样」,答案必须锚定这一段真实经历。但模型只拿到公共历史(动作发生前那段,两种动作共享)和替代动作,没拿到事实后续(factual continuation,即动作发生之后实际拍到的画面)。公共历史里那辆从岔路冲出来的车还没出现,模型无从知道这一幕必须保留,于是可以生成一段流畅、合理、却漏掉这个事件的视频。视频好看,但答非所问。

作者用 Pearl 的因果阶梯给这个失败定名:直接预测停在第 2 级(干预),真正的反事实在第 3 级,需要 abduction(溯因),用事实后续去推断这个特定世界的状态。直接预测跳过了这一步。

方法

诊断之后给了一个故意做得很简单的免训练管线,四步,对应 abduction、action、prediction 三段:

全流程推理期完成,所有权重冻结。

结果

真车不可能提供反事实答案(每个场景只发生一次),作者转用 CARLA 模拟器:同一个世界可以换动作重放,从而拿到反事实真值。基准含 186 个 case、72 个初始布置、3 个城镇、3 类场景(岔路冲出、前车切入、前车制动),10 fps、576×320、15 帧历史。每个 case 跑世界三次:事实记录(事件发生)、反事实真值(目标轨迹下事件照常发生)、空参考(目标轨迹下事件不发生)。两个指标:恢复率(Rec,用 DINOv2 和 CLIP 算,0 为完全漏事件,1 为复现反事实参考)和 LPIPS(对反事实真值的感知距离)。

测试两个冻结骨干:Vista(扩散)、DrivingWorld(自回归 VQ)。总体对比:

模型指标直预测本文
VistaRec(DINOv2)0.380.70
VistaRec(CLIP)0.330.65
VistaLPIPS ↓0.4230.169
DrivingWorldRec(DINOv2)0.310.67
DrivingWorldRec(CLIP)0.240.64
DrivingWorldLPIPS ↓0.2910.211

直预测的恢复率全部低于 0.5,即更接近「事件没发生」的空参考。单看岔路冲出这类,Vista 的 Rec(DINOv2) 从 0.29 升到 0.75。消融显示事件信号主要来自 Transport,Complete 加 Combine 负责消除接缝、降 LPIPS。一个关键对照:只有用对时间、对场景的事实帧搬运才有效;用错时间的帧恢复率掉回接近直预测,用别的场景的帧能恢复事件但 LPIPS 大涨(几何错了)。

为什么重要

对做自动驾驶世界模型和仿真的人,这篇是一记清醒剂:被广泛宣传的「反事实能力」在严格因果意义上不成立,直接预测只是干预预测。这条结论用同骨干、同历史、同动作的干净对照坐实,排除了模型本身的嫌疑。

方法本身是离线分析工具,不是在线决策:它要读事实后续,而事实后续只有事后才有。定位是事故复盘、安全审计、责任鉴定这类回顾性场景。免训练、不碰权重的好处是,深度模型和世界模型一升级,收益自动转移。

局限与存疑

作者自陈主要局限是开环设定:周围车辆按脚本走、不响应自车。时间一长,周围智能体会反应(比如行人看到自车减速会停下),而搬运过来的证据会把「本该被新动作改变的行为」也固化进去,比如一个本会停下的行人继续走。扩展到闭环、反应式智能体是明确的下一步。方法只读事实后续,服务不了决策时刻(结果还没发生)。

存疑的地方:两个世界模型都在 CARLA 渲染域之外评测(它们不是在 CARLA 上训的),因果分析不依赖渲染域,但换一个在基准渲染域上训的模型会更让人信服。另外单目深度误差会劣化搬运证据、留下接缝,而空缺区域的画质直接继承骨干的补全能力,本文没量化深度误差的敏感度。

术语

原文与代码

社区讨论

相关论文

全部论文解读