清华北航 DriveTeach-VLA:教自动驾驶模型看清路况,刷新纪录
机器之心 · wechat · 2026-08-10
清华大学、北航与滴滴联合团队提出 DriveTeach-VLA 模型,旨在解决现有自动驾驶视觉-语言-动作(VLA)模型过度依赖文本推理而忽视视觉要素的问题。该论文已被 ECCV 2026 接收。
研究指出,大模型虽然能描述驾驶场景,但真正决定安全的是生成轨迹时的视觉注意力。为此,团队设计了三大模块:通过驾驶知识蒸馏(DVD)让模型聚焦关键交通对象;利用 2D 图像轨迹提示(2D-TGP)将抽象的鸟瞰图(BEV)轨迹映射到像素空间,激活基模固有的读图能力;最后进行行为对齐。该模型在 NAVSIM 测试中达到 90.4 PDMS,配合轨迹选择器更提升至 92.7,创下当前最优(SOTA)性能。
「研究」频道最新
- Hugging Face 详解 Muse Glimmer:专为本地智能体设计 — ariG23498 · 2026-08-10
- 研究:AI决策流程中,无条件预测准确率并非唯一指标 — joshgans · 2026-08-10
- 合成查询探测:直观对比不同 Embedding 模型相似度空间 — pppeer · 2026-08-10
- 《哥德尔、艾舍尔、巴赫》早预言了 AI:梯度下降或是终极“怪圈” — AymericRoucher · 2026-08-10
- OneEmo:统一多模态情感推理模型及数据集发布 — Jiahao Huang · 2026-08-10
- Hugging Face 技术博客:如何低成本实现大规模知识蒸馏 — Hugging Face Blog · 2026-08-10