隐藏未来轨迹后,自动驾驶 VLM 推理更可信
Buaa1 · hf · 2026-08-04
隐藏未来轨迹后,自动驾驶 VLM 的推理更可信
这篇论文研究的是自动驾驶 VLA/VLM 训练中的一个偏差:很多标注流程会在推理前把 GT future trajectory 暴露给 teacher model,从而产生 trajectory anchoring bias。
主要发现
当未来轨迹提前可见时,teacher 往往是在“给已知答案补理由”,而不是基于场景证据真正推断决策。这样得到的 CoT 更不忠实,尤其在因果更复杂的场景里,还会显著增加 hallucination。
方法
- 先去掉推理阶段对 GT trajectory 的直接暴露。
- 提出 AD-MCQ:把规划改写成“从多个明确候选轨迹里做选择”。
- 进一步提出 DEFT-RLVR:把未来轨迹从“决策前的锚点”改成“决策后的验证目标”。
实验结果
- DEFT-RLVR 提升了自动驾驶推理能力。
- 同时还能保持,甚至增强通用视觉能力。
- AD-MCQ 通过候选轨迹构造,可以控制难度,而且只依赖 VLM 推理。
结论
作者认为,未来轨迹更适合拿来做验证,而不是在推理开始前就把答案泄漏给模型。
「应用」频道最新
- Grok 现已支持直接观看视频链接并回答问题 — Kyrannio · 2026-08-04
- GlobalGPT 推出终端 CLI,可直接做聊天和多模态生成 — SarahAnnabels · 2026-08-04
- Replit 正成测试新模型最省事的入口 — amasad · 2026-08-04
- 测试数十款后,他只留下 8 个常用 AI 工具 — nikola_mr64990 · 2026-08-04
- Tesla FSD 到 2027 年初或每 10 天新增 10 亿英里 — mitchdeg · 2026-08-04
- Claude 提示词包称可免费从零搭建实用技能 — nikola_mr64990 · 2026-08-04