Dyna-2 用百万小时人类视频预训练,机器人成功率提升至 53%
JasonMa2020 · x · 2026-08-11
Dyna Robotics 推出了全新的世界-动作模型(WAM)Dyna-2,该模型在超过 100 万小时的真实人类第一人称视频上进行了预训练。
- 学习机制:通过联合预测下一帧视频和动作来进行学习,其中视频预测(即世界建模)是将人类行为知识迁移给机器人的关键。
- Scaling 效果:增加人类视频数据量可显著提升动作预测能力。在零机器人数据的预训练下,任务准确率跨越不同实体(双臂和通用人形机器人)均有提升。
- 实测对比:在仅用几小时机器人数据进行后训练后,随着人类预训练数据从 1k 小时扩展到 1M 小时,平均任务性能从 20% 跃升至 53%。
- WAM vs VLA:在同等条件对比下,WAM 的成功率是 VLA(视觉语言动作模型)的 1.55 倍,并在 65% 的正面交锋中获胜。在未见过的客户现场进行零样本部署时,WAM 通过了 87% 的任务,远超 VLA 的 46%。
所属事件:Dyna-2:百万小时人类视频预训练,发现具身扩展定律(15 条相关)→
「具身」频道最新
- Kyle Vogt机器人公司因 Airbnb 变实验室被诉 — MarwaEldiwiny · 2026-08-11
- Dyna-2 模型成功迁移至 WUJI2 灵巧手,13 分钟数据极速适配 — JasonMa2020 · 2026-08-11
- MIT推出GeoPT模型:融入物理常识,仿真数据需求锐减60% — nordicinst · 2026-08-11
- MIT联合清华提出GeoPT:物理将成为AI第三大模态 — MIT News AI · 2026-08-11
- 亚马逊大砍Nova模型团队,全面转向机器人研发 — max_paperclips · 2026-08-11
- 大厂机器人工程师年薪超 40 万美元,初创公司面临算术难题 — ATTlKA · 2026-08-11