仅用15小时视频训练出可零样本泛化的机器人世界模型

研究人员提出Masked Visual Actions(MVA)方法,成功将预训练视频模型转化为机器人世界模型。该模型仅使用15小时的单臂机器人操作视频进行训练,即可实现强大的零样本泛化能力。它不仅能适应未见过的全新实体形态,甚至能泛化至猩猩等差异巨大的形态,大幅降低了机器人世界模型的训练数据门槛。

2026-07-24 ~ 2026-07-24 · 2 条相关