CMU 发布 R³:强化学习教机器人先想后动
CMU 团队(Aviral Kumar 组)发布新工作 R³,通过强化学习让机器人在行动前进行自由形式的自然语言推理,实现「先想后动」。方法分两步:先在专家生成的推理轨迹上做 mid-training,再用 RL 优化。研究指出测试时计算扩展不只是换更强的 LLM/VLM,而是在感知-行动循环中利用推理改变后续观察,从而提升策略控制。
2026-09-02 ~ 2026-09-03 · 3 条相关
- R3:通过强化学习训练机器人进行自然语言推理 — tw_killian · 2026-09-02
- 新论文 R³:用 RL 教机器人自由推理,先想后动提升策略控制 — aviral_kumar2 · 2026-09-03
- CMU 发布 R³:用强化学习训练机器人用自然语言推理 — aviral_kumar2 · 2026-09-03