NVIDIA 等发布 Long-WAM:19.2 秒视觉上下文让机器人任务成功率升至 78.7%
songhan_mit · x · 2026-10-09
NVIDIA、MIT、HKU、UCSD 联合发布 Long-WAM,一种可扩展上下文的世界-动作模型(World-Action Model),在保持实时控制的同时利用更长的视觉历史。要点:
- 上下文即能力:RoboCasa GR-1 上把上下文从 2.4 秒扩到 19.2 秒,成功率从 66.3% 升至 78.7%;双向初始化则无净收益
- AR 视频预训练是关键:先用无动作标签的机器人/第一视角视频学因果预测,再迁移到世界-动作适配;更长历史会放大 AR 预训练的优势
- 基准成绩:LIBERO-Long 99.5%、RoboTwin 2.0 平均 94.4%、Unitree G1 动态叠杯 19/20(95%)
- 实时部署:与运行时协同设计,RTX 5090 上每个动作块 107.4 ms,可部署于 DGX Spark 与 Jetson AGX Thor
模型、代码已在 arXiv/Hugging Face 开放。
所属事件:NVIDIA 发布 Long-WAM:19.2 秒视觉上下文提升机器人实时控制(5 条相关)→
「具身」频道最新
- 机器人操作研究学者受邀在德州农工大学分享跨具身学习工作 — YuXiang_IRVL · 2026-10-09
- AGI House 携手 Google Gemma 办全端侧硬件黑客松,120 名开发者参赛 — agihouse_org · 2026-10-09
- Odyssey 发布世界模型 Odyssey-3,Physics-IQ 刷出新 SOTA — Scobleizer · 2026-10-09
- 估值390亿美元人形机器人公司Figure,4年10万台目标进度起底 — annatonger · 2026-10-09
- Sentdex:多模态 LLM 零训练操控机器人,VLA 或只是插曲 — Sentdex · 2026-10-09
- 用户吐槽 Dot 缺 CallKit:电话功能本可更好用 — cheezemink · 2026-10-09