英伟达 Long-WAM:19.2 秒视觉上下文让机器人控制成功率升至 78.7%

arankomatsuzaki · x · 2026-10-09

英伟达联合 MIT/HKU/UCSD 发布 Long-WAM,在实时约束下扩展因果世界-动作模型(World-Action Model)的视觉历史上下文。

核心思路:先从机器人和第一人称视频无动作标签地学习因果预测,再在世界-动作适配阶段保留这种「历史到未来」结构。对比显示,更长的历史会放大 AR 视频预训练的优势;双向初始化无净收益。

关键数据:

项目页、代码和模型均已开放。

所属事件:NVIDIA 发布 Long-WAM:19.2 秒视觉上下文提升机器人实时控制(5 条相关)→

原文链接 →

「具身」频道最新

更多「具身」频道 AI 资讯 →