CMU 发布 R³:强化学习教机器人先想后动

CMU 团队(Aviral Kumar 组)发布新工作 R³,通过强化学习让机器人在行动前进行自由形式的自然语言推理,实现「先想后动」。方法分两步:先在专家生成的推理轨迹上做 mid-training,再用 RL 优化。研究指出测试时计算扩展不只是换更强的 LLM/VLM,而是在感知-行动循环中利用推理改变后续观察,从而提升策略控制。

2026-09-02 ~ 2026-09-03 · 3 条相关