SimpleMemVLA不设专用记忆模块,靠视觉历史拿下四项记忆基准SOTA
量子位 · wechat · 2026-09-18
面壁智能联合华中科大、人大、清华、北大、智源等机构提出 SimpleMemVLA:不给机器人加专用记忆模块,直接把带时间戳的分钟级视觉历史作为上下文输入 VLA,让模型结合过去理解当下。
- 成绩:四项记忆基准总体 SOTA,并在 RoboMemArena(26 项任务、轨迹平均超 1000 控制步)上,用 126 秒历史窗口将全阶段任务成功率提升至 63.6%,比此前最强高 17.4 个百分点;计数任务 31.4%→71.4%,遮挡任务 39.1%→64.3%。
- 核心思路:60 秒历史仅约 5.6k token,主干支持 262k 上下文,无需提前压缩。避免专用记忆的「写入时承诺」——存入时就决定留什么可能丢掉未来需要的信息。消融显示历史主要通过与词元嵌入、本体状态一起传给动作头的隐藏状态影响行为。
- 视觉上下文学习:不更新参数,拼接新轨迹片段(换遮挡位置、换颜色提示)即可让模型调整行为,且只对关键历史敏感。
- 流式推理:复用历史键值缓存、把共享前缀计算与动作执行重叠,60 秒历史决策延迟从 1.02 秒降至 0.68 秒(单张 H100、bf16),满足 0.96 秒实时预算;45 分钟/245k token 历史从 32.1 秒缩至 1.18 秒。
- 真机双臂演示中,机器人凭遮挡前的视觉历史按红→绿→蓝顺序揭盖,三次布局随颜色位置自适应调整路径。
论文与代码、模型已开源。
「具身」频道最新
- 斯坦福 FAMOS:稀疏单目点云前馈推断 3D 铰接物体关节参数 — Stanford-University · 2026-09-18
- Waymo 宣布 2028 年落地新加坡,进军东南亚首个自动驾驶出租车市场 — emmanuelvivier · 2026-09-18
- Agility Robotics 发布 Digit 5 人形机器人,专为与人类近距离协作设计 — emmanuelvivier · 2026-09-18
- 自动驾驶项目复盘:87.5% 时间在仿真,模仿学习优于车道估计 — abursuc · 2026-09-18
- CARLA 用特权地图专家采集数据训练视觉驾驶模型 — abursuc · 2026-09-18
- AMP 提出把机器人操控化为像素分类,绕开动作空间爆炸 — jiqizhixin · 2026-09-18