SSAD 2026 探讨用大模型监督自动驾驶小模型
在 SSAD 2026 研讨会的讨论中,研究者 abursuc 提出将 LLM 式的“think-ahead(预想未来)”思路引入自动驾驶:用大型教师模型监督小型学生模型对未来动作的预测,可视为一种早期 on-policy 蒸馏。同场还有研究尝试为驾驶任务打造专用奖励模型,用于识别碰撞、险些碰撞与次优驾驶行为,但作者坦承这类模型在可靠性上仍是挑战,且在不同任务上表现参差不齐。
2026-09-16 ~ 2026-09-16 · 3 条相关
- 研究者提观点:大教师模型监督学生未来动作,是驱动的早期 on-policy 蒸馏 — abursuc · 2026-09-16
- 用大模型监督小模型未来动作,自动驾驶早期 on-policy 蒸馏思路 — abursuc · 2026-09-16
- 自动驾驶专用奖励模型实测:崩溃与险情识别尚不可靠 — abursuc · 2026-09-16