研究者让人形机器人从自己的错误中继续学习

imjustnewatai · x · 2026-08-04

伯克利、Google DeepMind 和 NVIDIA 的研究者展示了:人形机器人可以不再依赖新的人工示教,而是从自己的失败里继续进步。

他们把 Gemini Robotics On-Device 放进一台 Unitree G1,在三个真实任务上测试,并用 reward model 标记每次尝试里哪些步骤有帮助、哪些步骤有害,再把这些互动转成新的训练数据,进入下一轮闭环微调。

两轮练习后、每个任务 100 次试验的结果:

更重要的不只是分数变高,而是机器人开始出现原始人类示教里没有的行为,比如先转动箱子再抓取、第一次插入失败后主动重试。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →