研究者称强化学习难以解决分布外泛化难题
机器人研究者 Chris Paxton 发文《强化学习的局限》并展开讨论,指出过去一年 AI 的爆发式进展主要归功于强化学习,但 RL 与真正的分布外泛化相悖:它依赖我们能良好模拟或模拟成本可控的环境。他以 DeepSeek R1 为例强调 RL 并非数据墙的解药,对无法模拟的任务仍是硬伤。
2026-09-04 ~ 2026-09-04 · 2 条相关
- 研究者指出 RL 驱动的 AI 进展难以覆盖真正分布外泛化 — chris_j_paxton · 2026-09-04
- Chris Paxton:RL 撑不起数据墙,模拟不了的任务仍是硬伤 — chris_j_paxton · 2026-09-04