研究者让人形机器人从自己的错误中继续学习
imjustnewatai · x · 2026-08-04
伯克利、Google DeepMind 和 NVIDIA 的研究者展示了:人形机器人可以不再依赖新的人工示教,而是从自己的失败里继续进步。
他们把 Gemini Robotics On-Device 放进一台 Unitree G1,在三个真实任务上测试,并用 reward model 标记每次尝试里哪些步骤有帮助、哪些步骤有害,再把这些互动转成新的训练数据,进入下一轮闭环微调。
两轮练习后、每个任务 100 次试验的结果:
- 装箱:93% → 100%
- 插杯:70% → 98%
- 递盘:53% → 96%
更重要的不只是分数变高,而是机器人开始出现原始人类示教里没有的行为,比如先转动箱子再抓取、第一次插入失败后主动重试。
「具身」频道最新
- RethinkX 称人形机器人可能带来惊人的生产率回报 — adam_dorr · 2026-08-04
- 观点:AI 硬件将如衣物般多样化,多设备协同是未来 — msalbergo · 2026-08-04
- 手术机器人给医生的空间信息,甚至不如特斯拉 — ditzikow · 2026-08-04
- 零基础用 Codex 搓出久坐提醒猫爪硬件 — 数字生命卡兹克 · 2026-08-04
- Raspberry Pi 字幕设备把通话和室内对话转成实时字幕 — tom_doerr · 2026-08-04
- H3 视频模型据称修复体操比例难题,还能做 3D 动作重建 — andrew_n_carr · 2026-08-04