英伟达 Long-WAM:19.2 秒视觉上下文让机器人控制成功率升至 78.7%
arankomatsuzaki · x · 2026-10-09
英伟达联合 MIT/HKU/UCSD 发布 Long-WAM,在实时约束下扩展因果世界-动作模型(World-Action Model)的视觉历史上下文。
核心思路:先从机器人和第一人称视频无动作标签地学习因果预测,再在世界-动作适配阶段保留这种「历史到未来」结构。对比显示,更长的历史会放大 AR 视频预训练的优势;双向初始化无净收益。
关键数据:
- RoboCasa GR-1:上下文从 2.4 秒增至 19.2 秒,成功率从 66.3% 升至 78.7%
- LIBERO-Long 99.5%、RoboTwin 2.0 平均 94.4%
- 协同设计的运行时在 RTX 5090 上每个动作块仅 107.4ms(含未来预测),可部署到 DGX Spark 和 Jetson AGX Thor
- Unitree G1 动态叠杯 95%(19/20);RoboCasa365 配合 GPT-6 Astra 达 54.4%(50 任务)
项目页、代码和模型均已开放。
所属事件:NVIDIA 发布 Long-WAM:19.2 秒视觉上下文提升机器人实时控制(5 条相关)→
「具身」频道最新
- ENPIRE 让编码 Agent 自主做机器人研究,灵巧任务成功率 99% — chris_j_paxton · 2026-10-09
- Odyssey-3 实测:冻结主干训练 20 小时驾驶数据即可迁移 — testingcatalog · 2026-10-09
- 机器人操作研究学者受邀在德州农工大学分享跨具身学习工作 — YuXiang_IRVL · 2026-10-09
- AGI House 携手 Google Gemma 办全端侧硬件黑客松,120 名开发者参赛 — agihouse_org · 2026-10-09
- Odyssey 发布世界模型 Odyssey-3,Physics-IQ 刷出新 SOTA — Scobleizer · 2026-10-09
- 估值390亿美元人形机器人公司Figure,4年10万台目标进度起底 — annatonger · 2026-10-09