VLA过时了?世界模型在7项复杂任务中成功率超VLA

CyberRobooo · x · 2026-08-11

推文探讨了机器人领域 VLA(视觉-语言-动作)模型是否已被超越。在 Dyna 的 WAM(世界动作模型)与 VLA 的对比实验中,两者使用相同预训练数据,结果显示 WAM 的平均成功率是 VLA 的 1.55 倍。

在开瓶、拧钥匙、折叠等复杂操作任务上,WAM 展现出明显优势。例如拧钥匙任务在 100K 小时预训练下几乎无法完成,但在 1M 小时规模下成功率可达 90%。此外,NVIDIA 提出的 EgoScale 方法通过引入 2 万小时以上的人类第一人称视频数据,也使灵巧操作成功率提升了 54%。

这两种技术路线正在收敛:VLA 侧重将人类数据与机器人任务连接,而 WAM 则通过学习物理世界的演化规律(如视频预测)来输出动作。

所属事件:Dyna Robotics发布Dyna-2,百万小时视频预训练刷新扩展律(27 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →