Chris Paxton:RL 撑不起数据墙,模拟不了的任务仍是硬伤
chris_j_paxton · x · 2026-09-04
机器人研究者 Chris Paxton 在回复讨论中重申其博客文章《强化学习的局限》的核心论点:
- RL 不是数据墙的解药。虽然 DeepSeek R1 用 RL 训练推理、Unitree/EngineAI 等用它训练机器人动作,RL 很强大,但它是特定场景的特定工具,不是万能方案。
- 过去一年 AI 进步主要由 RL 驱动,而 RL 依赖可模拟、可高效验证的任务环境。这与真正的分布外(OOD)泛化直接冲突。
- 推论:要么世界模型(world models)大幅进步,让模拟覆盖更多真实任务;否则在难以模拟或模拟成本极高的领域,人类直觉和学习仍占优势,RL 无法弥补。
- 文章进一步论证:agent 训练需要动作+观测的完整数据序列,能力线性提升需要越来越多的数据,机器人领域这类数据甚至根本不存在。
所属事件:研究者称强化学习难以解决分布外泛化难题(2 条相关)→
「漫话AGI」频道最新
- 网友预判:老年照护者与学校助教都将由 AI 担任 — ___Patrice___ · 2026-09-04
- AI 让写代码变便宜,但工程判断力反而更值钱了 — _jaydeepkarale · 2026-09-04
- 全球经济正把资本与算力疯狂押注超智能竞赛 — haider1 · 2026-09-04
- 围棋 AI 水平跃升靠开源:人类只有看懂策略才能学会 — thesephist · 2026-09-04
- zetalyrae:AI 治理比技术对齐更可行,一年前主流 rationalist 不这么想 — zetalyrae · 2026-09-04
- Mollick 补充:Fable 同理,开源模型达到同级后风险也一样 — emollick · 2026-09-04