新法 Q-Planning 让机器人半小时自我精进,成功率从 25% 升至 80%

animesh_garg · x · 2026-08-31

机器人传统模仿学习在精细任务上难以自我改进。新提出的 Q-Planning 方法引入一个小型的“评论家”模块,对机器人可能的下一步动作进行打分。

核心原理:

实测效果:

论文链接:Beyond Imitation: Self-Improving Robot Policies via Off-Policy Q-Planning

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →