MaskedVisualActions用像素轨迹让视频模型直接看懂机器人动作

斯坦福大学、马里兰大学和哈佛大学团队提出MaskedVisualActions方法,为视频模型设计了一种像素空间动作接口。该方法将机器人动作渲染为像素级运动轨迹,使视频世界模型能直接“看懂”动作,而无需处理抽象的数值控制指令。实验表明,在RoboCasa基准测试中,该技术使机器人任务成功率最高提升了26个百分点,有效推动了视频模型向统一世界模型与具身控制器的转化。

2026-07-22 ~ 2026-07-23 · 2 条相关