斯坦福等提出 Masked Visual Actions,视频模型秒变机器人世界模型

jiqizhixin · x · 2026-08-03

斯坦福大学、马里兰大学和哈佛大学的研究人员联合提出了一种名为 Masked Visual Actions(MVA)的新方法,能够将视频模型转化为机器人世界模型。

该方法通过在像素空间中揭示部分机器人运动(即遮罩视频的特定部分),让模型学习预测场景对动作的反应,并推导出实现目标的最佳动作。

关键亮点:

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →