看见正确轨迹就编理由:把自动驾驶规划改成可验证选择题

Deferred Exposure of Future Trajectories for Verifiable Reasoning in Autonomous Driving VLMs

Zixuan Huang, Yang Zhou, Kaixuan Wang, Guli Zhang, Hongyan Xie, Yakun Zhu, Hao Geng, Yikun Ban, Deqing Wang

cs.AI

2026-08-03

教师模型看见正确轨迹会倒推编理由,严重幻觉从 29% 升到 50%;把规划改成可验证选择题、推迟暴露答案后,准确率达 77.9% 且通用视觉能力不降。

这篇在解决什么

把大模型塞进自动驾驶,主流做法是用一个视觉语言模型(VLM)负责「看懂路况、想清楚怎么开」,再交给一个小得多的动作专家输出轨迹。为了让 VLM 的思维链(CoT)更靠谱,业界普遍让一个教师模型看着「正确答案」(日志里的真实未来轨迹)来生成训练用的推理过程。

这篇抓住一个被忽视的副作用:教师模型一旦提前看到正确轨迹,就会倒着把结论圆回来,而不是从画面证据推出来。论文管这叫轨迹锚定偏差,对应认知心理学里的锚定效应。作者做了人工评分对照实验,看到答案的那组严重幻觉率从 29% 飙到 50%,人工成对偏好从 60.5% 掉到 24%,退化集中在最需要硬推理的因果复杂场景。

这是真问题:模型选对了动作,支撑它的思考过程却是编的,拿这种数据去训,等于把合理化当成推理能力。

方法

解法分两层,先解决怎么评判,再解决怎么训练。

第一层 AD-MCQ。直接让模型生成连续轨迹很难判对错,也把高层决策和精确几何搅在一起。于是作者把规划改成选择题:用 K-means 在 48.9 万条真实轨迹上聚出 8192 个离散原型(相当于 8192 种典型开法),每个场景把真实轨迹映射到最近的那个原型,再按相似度捞干扰项凑成多选题。选对就是选对,可以精确判定,不用吐坐标。

但选项一开始就摆出来,模型会偷懒比较选项本身,等于把「正确答案锚」换成「候选集锚」。第二层 DEFT 解决这个,推理分两轮。第一轮只给画面,逼模型先基于证据给一个高层决策(比如「该减速让行」),候选轨迹藏起来;第二轮才亮选项,让模型把刚做的决策匹配到最接近的那条轨迹。决策在前,轨迹在后,轨迹只用来验证。

训练用 GRPO(群体相对策略优化,DeepSeek-R1 那套),奖励是「答对选择题」乘以「推理过程评分」。过程评分靠离线生成的逐题细则:一个 VLM 针对每个场景列出画面里该被引用的证据点,在线只跑一个文本裁判核对推理链命中了几条。关键设计是,真实轨迹从不进第一轮推理、也不进细则生成器,裁判也看不到画面和选项,只看文本。这样既给可验证硬信号,又不让答案漏回推理。

结果

主体实验在 Qwen3-VL-8B 和 Qwen3.5-4B 上做,评测集 AD-MCQ-500 含 500 个偏因果复杂的场景。

设置 (Qwen3-VL-8B)选择准确率因果忠实度 CFS
基座,候选给全,不训练28.1%
DEFT,仅推理改两轮56.6%0.431
候选可见 + 同样 RLVR 奖励61.1%0.428
DEFT-RLVR 完整方法77.9%0.658

光把候选藏起来分两轮推理(不训练),准确率就从 28.1% 拉到 56.6%。奖励信号完全相同时,藏候选比亮候选高 15.3 个百分点,直接说明锚定在拖后腿。加上细则奖励,DEFT-RLVR 到 77.9%,因果忠实度从 0.431 升到 0.658。

通用视觉能力几乎没受影响是关键:12 个通用视觉基准平均分从 54.81% 升到 56.09%。对照之下,用教师模型蒸馏会让通用能力掉到 49.80%。强化学习只调自己采样的 token 概率,不像蒸馏那样硬拽整个分布,这是它保住通用能力的原因。换到没见过的 nuScenes 数据集,准确率从 39.6% 提到 49.5%,说明学到的不是源数据集的视觉捷径。细则奖励只比纯正确性奖励多 0.5% 训练开销。

为什么重要

对做自动驾驶端到端的人,这篇的主要贡献是方法论:把规划变成答案可验证的选择题,就绕过了强化学习里最难搞的奖励可验证性。不需要闭环仿真、不需要动作专家,单靠 VLM 就能跑 RLVR,难度还能靠干扰项构造来调,后续工作可以拿它当标准实验台。

对做推理模型训练的人,锚定偏差这个发现本身就是提醒:别让生成 CoT 数据的教师模型提前看见答案,否则训出来的推理很大一部分是合理化,难场景上尤其会露馅。这个教训不限于自动驾驶,凡「先给答案再让它解释」的数据构造都中招。

局限与存疑

论文没有单列局限章节,下面几条是读完全文后的存疑。

第一,全部评测都是开环日志回放(在 Waymo 和 nuScenes 上选选项),没有闭环驾驶或上路验证。从多选一里挑对一条轨迹,离真把它开出来还有距离。

第二,选择题是代理任务。轨迹量化成 8192 个原型,重建误差地板在 0.279 米 ADE,轨迹精度被码本封了顶;真车控制需要连续输出,这套方案没直接解决。

第三,因果忠实度 CFS 和 HLD 这两个核心指标是 3970 亿参数的大模型打的分,不是客观真值,存在裁判偏置风险。作者在附录给了与人工标注的一致性,但仍属模型裁判。

第四,锚定偏差这个结论靠一个 100 场景的人工研究,样本不算大。这篇也只动了 VLA 架构里的 VLM 推理头,下游动作专家和整套端到端栈没有端到端验证。

术语

原文与代码

相关论文

全部论文解读