15 小时微调把视频轨迹变成机器人控制接口

Hadi Alzayer · hf · 2026-07-22

Masked Visual Actions 提出了一种给视频模型用的像素空间动作接口,目标是把视频模型变成统一的 world model / 具身控制器。

方法不是用抽象动作 token,而是把动作表示成“某个实体轨迹的部分显露”。如果显露机器人轨迹,模型就充当前向动力学模型,预测低层动作对场景的影响;如果显露目标物体轨迹,模型又能反推出与该结果一致的机器人行为。作者只用 15 小时来自真实视频和模拟的 masked 样本做微调,就得到一个可跨场景、跨 embodiment 使用的 checkpoint;它还能用于 rollout 评估、候选未来排序和从目标运动反推机器人动作。

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →