NVIDIA Long-WAM:扩展世界-动作模型上下文,动态堆杯成功率 95%
nvidia · hf · 2026-10-08
NVIDIA 发布 Long-WAM,一个在实时控制约束下扩展因果世界-动作模型(World-Action Model)上下文的模型-系统框架。核心发现是「拥有历史不等于用上历史」:更长的视觉历史只有在视频基座采用自回归(AR)预训练时才显著见效。
要点:
- 先从机器人与第一人称视频学习因果预测(无需动作标签),再在世界-动作适配阶段保留这种历史到未来的结构;
- RoboCasa GR-1 上,上下文从 0 秒增至 19.2 秒,成功率从 63.3% 升至 78.7%,而双向预训练初始化无净收益;
- 在 LIBERO-Long、RoboTwin 2.0、DOMINO 上均为对比方法中最佳;
- 流式观测编码、异步执行与硬件加速使其可部署在 RTX 5090、DGX Spark、Jetson AGX Thor 上,RTX 5090 单个动作块(含未来视频隐变量预测)耗时 107.4ms;
- 在 Unitree G1 与 YAM 上实时部署,动态杯子堆叠成功率 95%,而 Pi0.5 与 Fast-WAM 在 20 次尝试中全部失败;
- 作为记忆驱动的执行器,还能与高层规划配合完成复合任务。
「具身」频道最新
- RoboQuest 基准:最强多模态智能体具身探索成功率仅 23% — declare-lab · 2026-10-08
- RobotWorld 基准:84 个物理任务测试多模态机器人智能体 — Zhiqin Yang · 2026-10-08
- 日本 Donut Robotics 人形机器人进养老院,百余家护理机构试点 — CyberRobooo · 2026-10-08
- Reality Check 基准同任务同数据对比 π0.5 与 MolmoAct2 — Stefania_druga · 2026-10-08
- 机械臂末端执行器没有标准答案:简单夹爪 vs 人形灵巧手的深度拆解 — _Stocko_ · 2026-10-08
- UMI 数据采集 8 周从 5 人扩到 90 人,任务超百万 — HildeKuehne · 2026-10-08