Memory as Plans: World-Action Modeling with Memory-Grounded Planning
Sizhe Zhao, Haozhe Xie, Weiyu Zhao, Chenchu Zhang, Huan Wang, Chenyang Wang, Qinglin Liu, Shengping Zhang
cs.RO
2026-09-10
MaP-WAM 把长程多模态记忆只留给规划,执行器只跟固定长度的语言-视觉计划跑。RMBench 成功率 83.3%,真机 78%,动作块延迟大约锁在 827ms。
主流视觉-语言-动作(VLA)模型和世界-动作模型,把出动作当成马尔可夫过程:当前观测,或固定一小段历史,就够了。真实操作里很多任务不是这样。按钮被盖住、积木换过位置、白板上的数字只闪过一次,当前画面里什么都没有,决策却必须用那份已经看不见的信息。
现有记忆两条路都别扭。语言摘要压得紧,颜色、位置、物体身份这类细粒度证据会丢。把历史帧窗口越拉越长,覆盖是够了,执行器延迟和显存跟着涨。因果世界模型 LingBot-VA 在大约 1700 帧处直接显存溢出。覆盖和速度被绑在同一根轴上。
MaP-WAM 的判断是:长程视觉历史不该在每个控制步都喂给执行器。它主要用来决定下一段要干什么、画面该怎么演化。执行器跟着一份压好的计划跑。
记忆按已完成片段记账。每个片段留一条语言指令,再均匀抽 8 帧当稀疏视觉上下文。规划分两步:
执行器是 World-Action-Progress(WAP):在预训练视频 DiT 上加动作专家(1.02B)和进度专家(207M),Mixture-of-Transformers 一起预测未来视觉、动作块和归一化进度。一段计划要跑多久事先不知道,平均预测进度超过阈值 τ=0.95 就切下一段。递归预测会漂,所以用计划-观测对齐校准:拿当前观测去匹配视觉计划里邻近帧,把进度锚回计划。切段时,真实执行画面重新采样写回记忆,生成画面不进长期上下文。
执行器输入长度固定,计划前缀可 KV cache。规划只在切段时调用,日常延迟由动作生成主导。
仿真基准 RMBench,每任务 50 条官方示范、100 次评估:
| 方法 | 平均成功率 |
| Diffusion Policy | 5.8% |
| π0.5 | 10.4% |
| X-VLA | 9.8% |
| Mem-0 | 42.0% |
| LingBot-VA | 77.1% |
| MaP-WAM | 83.3% |
Swap T 和 Press Button 都到 96%。Observe and Pick Up 要在几十种物体里对上时间分隔开的观测,从最强基线的 9% 提到 19%。Rearrange Blocks 上 LingBot-VA 是 100%,MaP-WAM 只有 66%,平均分并不能掩盖单任务掉队。
真机是 7 自由度 Franka Research 3。Find Button 88%、Press Buttons 68%,各 50 次试验,合计 78.0%。进度消融里,把进度改成「片段是否结束」的分类,三任务平均掉到 37.0%;去掉进度条件掉到 54.0%;去掉校准掉到 73.7%;完整模型 96.7%。Press Button 尤其吃进度条件,去掉之后成功率从 96% 掉到 18%,按和松在画面上太像,没有时间坐标就会漏按或连按。
执行器每块动作延迟大约锁在 827ms。对照的全历史执行器即便开 KV cache,1500 帧时延迟大约是零历史的 4 倍,1700 帧附近超过 80GB 显存溢出。
对要做长程操作的人,这篇把「记什么」和「怎么动」拆开了。记忆留在规划侧,执行侧上下文不再跟任务时长绑死。这是工程上能落地的取舍,不是又把窗口加大一号。
代价也很清楚:依赖现成的片段标注,WAP 还是单任务训练,规划器才是多任务。想直接当通用 VLA 用还早。827ms 的动作块对高频控制偏慢,论文没有给墙钟控制频率。
作者自己写了两条。目前靠基准自带的片段结构组织记忆和进度,未分割示范需要自动发现片段。计划-观测对齐用的是无训练轻量匹配,视觉复杂场景可能要学相似度。
Rearrange Blocks 明显弱于把整段历史留给执行器的 LingBot-VA,说明历史从执行器拿走以后,有的任务会丢。真机只有两类任务,泛化半径还没测开。稀疏 8 帧能不能保住任意细粒度证据,也只在 RMBench 这套任务上成立。