世界模型内训机器人策略,全程零仿真器,真机上零样本部署
chris_j_paxton · x · 2026-09-04
Joseph Amigo 等人(NYU/ISIR,RoboPapers 社区)发布预印本《Coupled Local and Global World Models for Efficient First Order RL》,提出在纯学习到的世界模型里完成 RL 策略训练并直接部署到真实机器人。
核心问题:世界模型 RL 通常不可行——要做梯度回传需要精确的接触动力学,这要求模型大到计算成本无法接受。
方法:解耦一阶梯度(FoG)RL——
- 大规模全局世界模型(Push-T 用 DIAMOND,自我中心任务用 DreamerV4)负责生成高保真的前向轨迹;
- 一个轻量的潜空间局部代理模型近似其局部动力学,用于高效梯度计算;
- 世界模型本身也从真实世界数据从零学习,全程不依赖仿真器。
结果:策略在世界模型内从零训练后零样本部署到真实硬件:桌面机械臂 Push-T、G1 人形机器人自我中心抓取举起、Go2 四足推方块。在经典 Push-T 真机基准上样本效率显著优于 PPO,更复杂的自我中心操作任务也有类似收益。代码即将发布。
所属事件:耦合局部与全局世界模型,机器人零仿真器学会富接触操作(2 条相关)→
「具身」频道最新
- 开发者拟开售儿童 AI 手持设备,集讲故事问答想象于一体 — pramodk73 · 2026-09-04
- 华盛顿大学教授免费 39 集控制论课程:机器人背后的真功夫 — lukas_m_ziegler · 2026-09-04
- AR 眼镜操控 Unitree 机器狗导航,开源项目夺冠 Lenslist — Scobleizer · 2026-09-04
- DLSS 5 随 NBA 2K27 首发:4K 原生损失近半帧率 — ryanshrout · 2026-09-04
- 特斯拉无方向盘 Cybercab 上路数小时后,NHTSA 立案调查 — LexiLove · 2026-09-04
- 深圳公司把人形机器人与工业机械臂整合到一体 — LexiLove · 2026-09-04