模仿学习与RL的分布偏移争论

ftm_guney · x · 2026-07-15

作者认为,大家都在主张在模仿学习之上再加 RL,用来解决分布偏移问题;但现实是,开放基准里占优势的仍然是像 TFv5/6、DrivoR 这类模仿学习代理。 他因此反问:RL 所谓的“distribution shift”问题,是否真的像外界说得那么严重。

所属事件:模仿学习为何仍压过强化学习(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →