Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents
Wei-Chieh Huang, Weizhi Zhang, Yuchen Wu, Yankai Chen, Eric Hanchen Jiang, Wooseong Yang, Yiwei Yang, Henry Peng Zou, Hanrong Zhang, Ying Nian Wu, Haolun Wu, Kai-Wei Chang, Philip S. Yu, Xue Liu, Aylin Caliskan
cs.CL
2026-08-15
同一交互历史喂给 11 种记忆基底、3 个基座、4 个基准;图结构赢问答但被帕累托支配,蒸馏策略赢具身规划,注意力探针解释了原因。
长期记忆正在变成 LLM agent 的基础设施,但「用哪种存储介质」一直没有可信的实验答案。作者先扫了 2023 到 2026 年的 52 个记忆增强系统,发现三件事:62% 的评测集中在 LoCoMo 和 LongMemEval 两个对话数据集上,agent 任务几乎没人测;100% 报准确率,只有 21% 报任何效率指标;81% 只用 GPT 系基座,基底效果和模型特有行为搅在一起。结果是大家知道哪个系统在某榜上第一,不知道在什么运行条件下该换哪种基底,而这正是任何自适应记忆系统需要的路由信号。
这是篇评测论文,方法是控制变量本身:固定 harness、固定提示模板、固定辅助 LLM(GPT-4o-mini),把记忆基底变成唯一实验变量,11 种方法覆盖七大家族:
三基座(Qwen3-8B、Qwen3-32B-AWQ、Gemma-4-26B-A4B),四基准分两个 regime:用户中心的 LoCoMo、MemoryAgentBench(精确检索/长程理解/测试时学习/冲突消解),agent 中心的 ALFWorld 具身规划、BigCodeBench-Hard 代码生成。26 个指标把存储、写延迟、检索延迟、token 与调用次数全量记录。Zep、Mem0、MemGPT 因生产管线带来差异过大的辅助 LLM 开销,只进辅助成本分析不进主对比。
| 发现 | 关键数字 |
| 问答 regime 图结构最强 | LoCoMo 上双级图 P4 0.648–0.719,但每查询延迟 26–29s,是稀疏向量的 50 倍以上 |
| 具身规划蒸馏类最强 | ALFWorld 上策略蒸馏 TSR 32.1%(Qwen3-32B),裸向量检索有涨有跌 |
| 检索深度效应反转 | LoCoMo P4 随 k 单调升;ALFWorld TSR 随 k 单调降(32.1%→约 25%) |
| 注意力转移是机制 | k 从 0 到 20,任务上下文的注意力质量 0.34→0.10,检索块 0.05→0.66 |
| 长历史代价分化 | 262K token 时结构化基底的图重建延迟陡增,精炼类读成本与输入长度无关 |
两个 regime 的帕累托前沿完全不相交:问答前沿站着图和层次树,agent 前沿站着扁平检索(BCB 上 +2.0% 只花 1.28× 延迟)和策略蒸馏(ALFWorld 上 +9.7% 花 1.23×)。注意力探针给出机制解释:两个任务里注意力都从上下文被虹吸进检索块,但问答的答案就住在检索块里,所以是好事;ALFWorld 的决策依据是当前观察和可行动作列表,同样的转移就是在饿死决策。BRE 超出 k=1 后步数涨向 cap,过度检索的 agent 不是失败,是徘徊。
给「agent 记忆该怎么做」这条热门赛道提供了第一份有控制变量的地形图,三个结论都能直接改设计:检索深度不是全局超参而是 regime 条件超参,该由「答案住在提示词的哪个区域」决定;重机制只有在机制对准任务瓶颈时才值回延迟,否则是纯税(BCB 上 M5/M9/M11 付出 3.7–8.0× 延迟反而低于无记忆基线);写侧投蒸馏、读侧少取数(trade read breadth for write depth)是跨 regime 稳赚的设计规则。终局判断也明确:没有单一基底能同时服务长程回忆、注意力压力下的决策和长历史扩展,通用记忆必须是多基底按 regime 路由的组合系统。
基底实现是作者自己按原论文复现的,复现质量差异会混进对比(论文也承认 Zep/Mem0/MemGPT 因管线差异被移出主表,剩下的实现同样有这个问题)。辅助 LLM 全部固定 GPT-4o-mini,这对写侧重的基底(图构建要大量 LLM 调用)可能偏不利,换强些的辅助模型结论未必不变。三基座都是 30B 以下开源模型,结论对百亿级以上或 GPT 系基座是否成立未验证。ALFWorld 134 个任务、BCB 148 个任务的样本量下,几个点的差距要谨慎读。评测本身没有动态记忆管理(写入策略固定),而真实系统的瓶颈常在写入侧。