VLA过时了?世界模型在7项复杂任务中成功率超VLA
CyberRobooo · x · 2026-08-11
推文探讨了机器人领域 VLA(视觉-语言-动作)模型是否已被超越。在 Dyna 的 WAM(世界动作模型)与 VLA 的对比实验中,两者使用相同预训练数据,结果显示 WAM 的平均成功率是 VLA 的 1.55 倍。
在开瓶、拧钥匙、折叠等复杂操作任务上,WAM 展现出明显优势。例如拧钥匙任务在 100K 小时预训练下几乎无法完成,但在 1M 小时规模下成功率可达 90%。此外,NVIDIA 提出的 EgoScale 方法通过引入 2 万小时以上的人类第一人称视频数据,也使灵巧操作成功率提升了 54%。
这两种技术路线正在收敛:VLA 侧重将人类数据与机器人任务连接,而 WAM 则通过学习物理世界的演化规律(如视频预测)来输出动作。
所属事件:Dyna Robotics发布Dyna-2,百万小时视频预训练刷新扩展律(27 条相关)→
「具身」频道最新
- 机器人专家呼吁:云推理 200ms 延迟是致命伤,端侧部署不可替代 — vaibhavbetter · 2026-08-11
- 机器人VLA研究OAT入围顶会杰出论文,实测覆盖60+任务 — Haoyu_Xiong_ · 2026-08-11
- MIT 提出 DAAAM:利用视觉大模型实时构建 3D 动态场景图 — tom_doerr · 2026-08-11
- Robotaxi 颠覆网约车与汽车产业,成本将低于私家车 — mitchdeg · 2026-08-11
- 500美元机械臂让3D打印机实现全自动连续打印 — FinanceYF5 · 2026-08-11
- 阿里千问开放平台上线,支持 AI 眼镜端技能开发 — 千问APP · 2026-08-11