研究者提观点:大教师模型监督学生未来动作,是驱动的早期 on-policy 蒸馏

abursuc · x · 2026-09-16

在 #ssad2026 研讨会分享中,作者指出可以把「think-ahead(预想未来)」思路引入 LLM 研究:用一个大的教师模型来监督小学生模型对未来动作的预测,稍微眯起眼看,这就是驱动(自动驾驶)领域一种早期的 on-policy 蒸馏形式。

同帖还提到表征研究的迭代:slot-based 中层表征效果不错,但 SAM2 等用隐式追踪的进展让研究者转向其他问题——「这就是研究:去啃那些还没被解决的问题」。

所属事件:SSAD 2026 探讨用大模型监督自动驾驶小模型(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →