模仿学习为何仍压过强化学习

围绕“模仿学习是否真需叠加 RL 才能解决分布偏移”的讨论升温。发帖者指出,公开 benchmark 中占优的仍多是 TFv5/6、DrivoR 等模仿学习代理,因此质疑 RL 被反复强调的鲁棒性优势是否被高估。

2026-07-15 ~ 2026-07-15 · 2 条相关