15 小时微调把视频轨迹变成机器人控制接口
Hadi Alzayer · hf · 2026-07-22
Masked Visual Actions 提出了一种给视频模型用的像素空间动作接口,目标是把视频模型变成统一的 world model / 具身控制器。
方法不是用抽象动作 token,而是把动作表示成“某个实体轨迹的部分显露”。如果显露机器人轨迹,模型就充当前向动力学模型,预测低层动作对场景的影响;如果显露目标物体轨迹,模型又能反推出与该结果一致的机器人行为。作者只用 15 小时来自真实视频和模拟的 masked 样本做微调,就得到一个可跨场景、跨 embodiment 使用的 checkpoint;它还能用于 rollout 评估、候选未来排序和从目标运动反推机器人动作。
所属事件:MaskedVisualActions用像素轨迹让视频模型直接看懂机器人动作(2 条相关)→
「具身」频道最新
- 外滩大会观察:AI 与硬件厂商分工成型,蚂蚁扮演攒局者 — 智东西 · 2026-09-11
- 亚马逊谷歌卖出6亿台音箱,AGI 时代为何无人再造智能音箱 — julianlehr · 2026-09-11
- ECCV26 口头论文:流匹配实现多视角点云配准 — ducha_aiki · 2026-09-11
- 波兰开发者做 iPhone 应用 可探测附近的 Meta 智能眼镜 — Low-Honeydew6483 · 2026-09-11
- 蚂蚁阿福用户达 1.5 亿,外滩大会展示 AI+硬件健康管理联盟 — APPSO · 2026-09-11
- JHU 开设全栈机器人学习课:组装机械臂、采数训练部署一条龙 — _krishna_murthy · 2026-09-11