MaskedVisualActions用像素轨迹让视频模型直接看懂机器人动作
斯坦福大学、马里兰大学和哈佛大学团队提出MaskedVisualActions方法,为视频模型设计了一种像素空间动作接口。该方法将机器人动作渲染为像素级运动轨迹,使视频世界模型能直接“看懂”动作,而无需处理抽象的数值控制指令。实验表明,在RoboCasa基准测试中,该技术使机器人任务成功率最高提升了26个百分点,有效推动了视频模型向统一世界模型与具身控制器的转化。
2026-07-22 ~ 2026-07-23 · 2 条相关
- 15 小时微调把视频轨迹变成机器人控制接口 — Hadi Alzayer · 2026-07-22
- 像素化机器人动作让 RoboCasa 成功率最高提升 26 个百分点 — 机器之心 · 2026-07-23