像素化机器人动作让 RoboCasa 成功率最高提升 26 个百分点
机器之心 · wechat · 2026-07-23
斯坦福大学、马里兰大学帕克分校和哈佛大学团队提出 MaskedVisualActions:把机器人动作渲染成像素级运动轨迹,让视频世界模型直接“看懂”动作,而不是处理数值控制量。
方法要点
- 将候选动作转换为可视化轨迹,统一输入到视频模型中。
- 同一模型既能做正向预测(动作 → 未来视频),也能做逆向生成(目标物体轨迹 → 可能的机器人行为)。
- 通过视觉接口,支持不同机器人本体的泛化。
实验结果
- 仅用约 15 小时机器人交互数据微调。
- 在 RoboCasa 任务里,加入视频模型预演后,成功率提升 7 到 26 个百分点。
- 生成视频中的策略表现与仿真结果相关系数达到 0.982。
- 在 CoffeeServeMug 任务上,逆向动作提取流程成功率达到 90%。
局限
方法仍受底层视频模型限制,容易出现物理不一致、过于乐观的未来预测,实际执行还需要额外的逆动力学与控制器配合。
所属事件:MaskedVisualActions用像素轨迹让视频模型直接看懂机器人动作(2 条相关)→
「具身」频道最新
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11
- SyncWorld:少量视觉校准即可零样本模拟机器人跨视角交互 — ChongZzZhang · 2026-09-11