NVIDIA Releases Long-WAM: 19.2-Second Visual Context Boosts Real-Time Robot Control
NVIDIA 联合 MIT、HKU、UCSD 发布 Long-WAM,一个在实时控制约束下扩展因果世界-动作模型(World-Action Model)上下文长度的模型-系统框架。它将视觉历史上下文从接近 0 扩展到 19.2 秒,在 RoboCasa GR-1 基准上任务成功率升至 78.7%,动态堆杯任务成功率达 95%,同时保持实时控制。
已确认
- Long-WAM 由 NVIDIA、MIT、HKU、UCSD 联合发布,论文与开源代码已放出
- 训练路径:先从机器人和第一人称视频中无动作标签地学习因果预测,再进行动作对齐(据 @arankomatsuzaki 转述)
- 量化结果:上下文从 0 到 19.2 秒,RoboCasa GR-1 成功率升至 78.7%;动态堆杯成功率 95%
- 关键实证发现:「拥有历史不等于用上历史」——更长视觉历史只有在视频基础模型采用自回归(AR)预训练时才能被真正利用
为什么重要
- 表明扩大模型可感知的时间上下文能直接提升机器人操作表现,「上下文即能力」
- 自回归预训练是让长期历史生效的关键条件,为视频基座模型用于机器人控制提供了明确的架构指引
- 在扩展上下文的同时满足实时控制约束,兼顾了长时序记忆与可部署性
2026-10-08 ~ 2026-10-09 · 5 related posts
Primary sources
- [source] NVIDIA's Long-WAM scales world-action model context, hitting 95% on dynamic cup stacking — nvidia · 2026-10-08
- NVIDIA releases Long-WAM, a world-action model scaling visual context for real-time robot control — _akhaliq · 2026-10-08
- [source] NVIDIA's Long-WAM extends world-action model context to 19.2s, lifting RoboCasa success to 78.7% — arankomatsuzaki · 2026-10-09
2 near-duplicate retellings: arankomatsuzaki · songhan_mit