研究者称强化学习难以解决分布外泛化难题

机器人研究者 Chris Paxton 发文《强化学习的局限》并展开讨论,指出过去一年 AI 的爆发式进展主要归功于强化学习,但 RL 与真正的分布外泛化相悖:它依赖我们能良好模拟或模拟成本可控的环境。他以 DeepSeek R1 为例强调 RL 并非数据墙的解药,对无法模拟的任务仍是硬伤。

2026-09-04 ~ 2026-09-04 · 2 条相关