斯坦福等提出 Masked Visual Actions,视频模型秒变机器人世界模型
jiqizhixin · x · 2026-08-03
斯坦福大学、马里兰大学和哈佛大学的研究人员联合提出了一种名为 Masked Visual Actions(MVA)的新方法,能够将视频模型转化为机器人世界模型。
该方法通过在像素空间中揭示部分机器人运动(即遮罩视频的特定部分),让模型学习预测场景对动作的反应,并推导出实现目标的最佳动作。
关键亮点:
- 数据高效:仅在 15 小时的数据上训练。
- 能力统一:单一检查点即可处理策略评估、基于模型的规划和动作提取。
- 泛化性强:能在多种环境和不同机器人本体之间实现零样本泛化。
「具身」频道最新
- 开源工具 Lichtblick:浏览器端的机器人数据可视化诊断 — tom_doerr · 2026-08-03
- Y Combinator 展示具身机器人 cosmic-1 — ycombinator · 2026-08-03
- 机器人武器化监管缺位:承诺靠自觉,不如大模型严 — alex_verem · 2026-08-03
- 机器人部署痛点:3D打印夹爪材料如何选择? — DominiqueCAPaul · 2026-08-03
- Lambda Surgical获650万美元:构建人体内部世界模型 — ditzikow · 2026-08-03
- 机器人专家:长期看腿比轮子更安全,但当前轮式更实用 — chris_j_paxton · 2026-08-03