CMU 发布 R³:用强化学习训练机器人用自然语言推理
aviral_kumar2 · x · 2026-09-03
CMU 团队(Aviral Kumar 组)发布 R³,研究 VLM 能否通过自然语言推理来指导低层操作策略。
方法分两步:先在专家生成的推理轨迹上做 mid-training 初始化推理风格,再用单步 rubric-based RL 从离线动作数据改进推理器。在 Language Table 和模拟双手杂货打包任务上,R³ 在未见任务上的泛化显著优于仅指令的模仿学习。
作者分享的教训:基础做法(mid-training + rubric RL)做对了就有效;关键在于谨慎选择让 VLM 训练推理的任务——团队花了不少时间才搞清什么时候需要推理。
所属事件:CMU 发布 R³:强化学习教机器人先想后动(3 条相关)→
「具身」频道最新
- 无方向盘无踏板的 Cybercab 已在奥斯汀街头无人行驶 — TinfoilTricorn · 2026-09-03
- 用 Blender MCP 教机器人小鸭滑滑板,尺寸全由机器人自定 — TinfoilTricorn · 2026-09-03
- 强化学习驱动平衡机器人系列完结,加入遥控指令操控 — ShawnHymel · 2026-09-03
- 人形机器人上台像晕倒山羊一样被拖走,网友笑称「越傻越可爱」 — eyishazyer · 2026-09-03
- Wayve 自动驾驶车队登陆 Uber,伦敦可叫无人驾驶车 — alexgkendall · 2026-09-03
- 开源陪伴机器人 Autonomous Lamp 售价 499 美元,带 70+ 技能商店 — dee_hw · 2026-09-03