世界模型内训机器人策略,全程零仿真器,真机上零样本部署

chris_j_paxton · x · 2026-09-04

Joseph Amigo 等人(NYU/ISIR,RoboPapers 社区)发布预印本《Coupled Local and Global World Models for Efficient First Order RL》,提出在纯学习到的世界模型里完成 RL 策略训练并直接部署到真实机器人。

核心问题:世界模型 RL 通常不可行——要做梯度回传需要精确的接触动力学,这要求模型大到计算成本无法接受。

方法:解耦一阶梯度(FoG)RL——

结果:策略在世界模型内从零训练后零样本部署到真实硬件:桌面机械臂 Push-T、G1 人形机器人自我中心抓取举起、Go2 四足推方块。在经典 Push-T 真机基准上样本效率显著优于 PPO,更复杂的自我中心操作任务也有类似收益。代码即将发布。

所属事件:耦合局部与全局世界模型,机器人零仿真器学会富接触操作(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →