像素化机器人动作让 RoboCasa 成功率最高提升 26 个百分点
机器之心 · wechat · 2026-07-23
斯坦福大学、马里兰大学帕克分校和哈佛大学团队提出 MaskedVisualActions:把机器人动作渲染成像素级运动轨迹,让视频世界模型直接“看懂”动作,而不是处理数值控制量。
方法要点
- 将候选动作转换为可视化轨迹,统一输入到视频模型中。
- 同一模型既能做正向预测(动作 → 未来视频),也能做逆向生成(目标物体轨迹 → 可能的机器人行为)。
- 通过视觉接口,支持不同机器人本体的泛化。
实验结果
- 仅用约 15 小时机器人交互数据微调。
- 在 RoboCasa 任务里,加入视频模型预演后,成功率提升 7 到 26 个百分点。
- 生成视频中的策略表现与仿真结果相关系数达到 0.982。
- 在 CoffeeServeMug 任务上,逆向动作提取流程成功率达到 90%。
局限
方法仍受底层视频模型限制,容易出现物理不一致、过于乐观的未来预测,实际执行还需要额外的逆动力学与控制器配合。
所属事件:MaskedVisualActions用像素轨迹让视频模型直接看懂机器人动作(2 条相关)→
「具身」频道最新
- Chelsea Finn:机器人 RL 的瓶颈是物理 rollout 成本 — ycombinator · 2026-07-27
- 机器人走到冰箱前拿出一瓶啤酒 — Darpinian · 2026-07-27
- 研究者用针织结构复现数字电路 — mtizard · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27
- TechCrunch 讨论脑波信号或成 physical AI 训练新钥匙 — TechCrunch AI · 2026-07-27
- YC 讨论具身机器人:预训练、记忆和组合行为才是关键 — ycombinator · 2026-07-27