清华北航 DriveTeach-VLA:教自动驾驶模型看清路况,刷新纪录

机器之心 · wechat · 2026-08-10

清华大学、北航与滴滴联合团队提出 DriveTeach-VLA 模型,旨在解决现有自动驾驶视觉-语言-动作(VLA)模型过度依赖文本推理而忽视视觉要素的问题。该论文已被 ECCV 2026 接收。

研究指出,大模型虽然能描述驾驶场景,但真正决定安全的是生成轨迹时的视觉注意力。为此,团队设计了三大模块:通过驾驶知识蒸馏(DVD)让模型聚焦关键交通对象;利用 2D 图像轨迹提示(2D-TGP)将抽象的鸟瞰图(BEV)轨迹映射到像素空间,激活基模固有的读图能力;最后进行行为对齐。该模型在 NAVSIM 测试中达到 90.4 PDMS,配合轨迹选择器更提升至 92.7,创下当前最优(SOTA)性能。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →