像素化机器人动作让 RoboCasa 成功率最高提升 26 个百分点

机器之心 · wechat · 2026-07-23

斯坦福大学、马里兰大学帕克分校和哈佛大学团队提出 MaskedVisualActions:把机器人动作渲染成像素级运动轨迹,让视频世界模型直接“看懂”动作,而不是处理数值控制量。

方法要点

实验结果

局限

方法仍受底层视频模型限制,容易出现物理不一致、过于乐观的未来预测,实际执行还需要额外的逆动力学与控制器配合。

所属事件:MaskedVisualActions用像素轨迹让视频模型直接看懂机器人动作(2 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →