Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence
Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang, Zhiyue Zhao, Yuling Xi, Hao Chen
cs.AI
2026-08-13
冻结视觉语言模型不做训练,靠经验记忆库和可信度打分检索,在四个模型二十项评测里近乎全胜,准确率反超训练式自进化方法16.4分。
提升VLM空间推理能力,过去主要两条路:后训练(监督微调、强化学习)和让模型调用外部空间工具(深度估计、三维重建)拿证据。两条路都要么改模型权重,要么依赖推理时的专家工具。论文问一个没人认真回答过的问题:冻结的VLM能不能靠维护一个外部记忆库,不改参数、不调专家工具,自己把空间推理能力提上去?
SMA(Spatial Memory Agent)分两个阶段。第一阶段是经验采集:冻结的VLM在一批带验证答案的空间题上作答,每道题的作答过程被反射模型(用的还是同一个冻结VLM)压缩成一张记忆卡,包含任务摘要和一条可迁移的经验教训——识别题型模式、常踩的坑、该做的检查。反射时能看到标准答案,但规则禁止直接把答案抄进记忆卡里。
每张卡再挂一个可信度分TRS(Transfer Reliability Score),初始值统一,之后每次这张卡被检索使用,就根据当次答题对错更新TRS,本质是把这张卡帮到了多少次变成一个在线校准的经验证据。第二阶段是只读部署:遇到新题先用语义相似度筛出候选卡,再用相似度和TRS的加权分二次排序,取分数最高的几张卡拼进提示词。部署阶段记忆库完全冻结,不再写入新卡也不再更新TRS。
一个反直觉的设计决定:多轮遍历环境集时只在第一轮写记忆卡(One-Pass),后续轮次只更新已有卡的TRS。消融显示持续写卡(Continual Writing)会让记忆库越滚越大、冗余越来越多,十轮下来卡片数是One-Pass的十倍,TRS更新覆盖率反而只有一半。
五个空间基准(RoboSpatial、ERQA、Omni3D、SAT、EmbSpatial)、四个冻结VLM(9B到122B-A10B)、二十组评测里,SMA在每个模型上的宏平均都是最优:
| 模型 | 无记忆基线 | 最强对照基线 | SMA |
| Qwen3.6-27B | 63.3 | 68.1(MemRL-GT) | 69.8 |
| Qwen3.5-122B-A10B | 65.3 | 66.2(MemRL-R) | 68.8 |
| Qwen3.5-9B | 60.6 | 60.7(MemP) | 63.5 |
对比训练式自进化方法SpatialEvo-7B(公开的7B checkpoint),SMA在同为Qwen3.5-9B基座下反超16.4分(63.5% vs 47.1%),五个基准全部领先。记忆库还能跨模型、跨基准迁移:用122B模型写的记忆库直接给27B模型用,RoboSpatial涨9.4分;用ERQA上写的记忆库迁到RoboSpatial上,涨7.6分。
对做agent记忆系统的人,这篇给出一个明确的对照实验结果:单纯语义相似度检索(RAG、MemP)在空间推理任务上经常不如不用记忆。SMA把最相似的检索基线(MemP)平均相似度从0.792压到0.698,准确率反而从66.8%涨到69.8%,说明检索到的记忆越像当前问题和这条记忆真的有用是两件事,需要一个独立的可信度信号去筛。这套TRS加语义过滤的组合拳,对任何要给冻结模型接外部记忆的场景(不限空间推理)都有参考价值,而且不用碰模型权重,工程成本低。
论文没有给出面对更大规模前沿模型(比如GPT-5、Gemini这类)时SMA是否还有类似增益,四个基座都是Qwen系列且顶多到122B-A10B。反射模型和答题模型是同一个冻结VLM,记忆卡的质量因此受限于模型自身的反思能力,论文没有测试用更强模型当教师来写记忆卡是否效果更好。TRS的可信度分箱曲线([0.2,0.3)区间准确率只有19.3%)混杂了题目本身难度的影响,论文自己也承认这一点。此外记忆库的可扩展性没有被系统评估,环境集只是几百到几千道题规模,记忆库在更大规模、更长期运行下是否会因为过时经验而拖累准确率,论文没有讨论。