CMU 发布 R³:用强化学习训练机器人用自然语言推理

aviral_kumar2 · x · 2026-09-03

CMU 团队(Aviral Kumar 组)发布 R³,研究 VLM 能否通过自然语言推理来指导低层操作策略。

方法分两步:先在专家生成的推理轨迹上做 mid-training 初始化推理风格,再用单步 rubric-based RL 从离线动作数据改进推理器。在 Language Table 和模拟双手杂货打包任务上,R³ 在未见任务上的泛化显著优于仅指令的模仿学习。

作者分享的教训:基础做法(mid-training + rubric RL)做对了就有效;关键在于谨慎选择让 VLM 训练推理的任务——团队花了不少时间才搞清什么时候需要推理。

所属事件:CMU 发布 R³:强化学习教机器人先想后动(3 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →