Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems
Gaurav Dadhich
cs.AI, cs.IR
2026-07-24
论文把生产 Agent 的上下文管理提成五原语生命周期,指出每轮全量累加成本 O(n²),校验压缩可做到 O(n) 且不损准确率。
生产环境的 AI agent 用着用着就「失忆」:跨会话记不住、交接时自相矛盾、上下文塞满后开始幻觉,而且每多一轮对话,token 账单就涨一截。作者的核心判断是,这些故障很少因为模型不会推理,更多因为它管不住自己脑子里该装什么。常见的解法把记忆当成「存与取」的存储问题,作者认为这个框太小。决定该记住什么、提取并结构化、按数据类型选存储、合并与遗忘同时保留来源、判断当下什么相关、预判接下来需要什么、在预算内压缩而不丢关键信息,这些动作横跨一个完整的生命周期,存储只是其中两个时刻。
作者把这个领域命名为 Agentic Context Management(ACM,智能体上下文管理),拆成五个原语:
参考实现 Maximem Synap 有几个设计选择:摄入异步(先返回 ID,后台处理),压缩返回显式校验分、不过就自动重试,身份从凭证推导而非客户端自报,检索是向量相似度加图遍历的混合。
成本论证是这篇最硬的部分。朴素地把每轮全量拼进上下文,累积 token 成本是 C = t·n(n+1)/2,即 O(n²);把每轮预算限在 W,成本变 n·W,即 O(n)。设每轮 500 token、预算 4000,50 轮时全量法已是预算法的 3.2 倍,500 轮时 31.3 倍。
三种路线对比:
| 路线 | 成本 | 保真度 | 失败模式 |
| 全量累加 | O(n²) | 满,直到上下文腐烂 | 成本爆炸 |
| 粗暴摘要 | O(n) | 有损、不校验 | 准确率悬崖 |
| 校验压缩 | O(n) | 保留并校验 | 目标:无 |
作者引了一个例子:把 18,282 token 压到 122,准确率从 66.7% 掉到 57.1%,比没有上下文还差。基准上,LongMemEval 全 500 题用 gpt-5-mini 做答案和判官,总分 92.0%;LoCoMo 第 1-4 类 93.2%。对比是 SuperMemory 约 85%、Zep 71.2%,但作者自己标明这是各家按自己方法自报,不是受控比较。
对做 agent 的人来说,这篇的价值在两块。一是把「上下文失控」这件事从工程杂活提成了一门有结构的学问,五个原语给了一张可以照着自查的清单:你现在的系统有没有实体消歧?有没有跨用户隔离?压缩有没有校验?二是 O(n²) 这个账算得清楚,长对话的 token 成本不是线性涨,是平方涨,这对成本敏感的生产场景是真问题。校验压缩这个方向比单纯摘要更可信。
这篇的弱点要直说。基准只测召回(accuracy),不测延迟、token 效率、高负载下的上下文腐烂抗性,而这些恰恰是它标榜要解决的生产问题。LongMemEval 92.0% 这种高分很大程度上是 gpt-5-mini 加这套配置的结果,不是系统本身的抽象属性。对比表是自报、非受控,SuperMemory 用的是不同模型和判官,严格说比不了。最难的跨会话推理只有 75.2%,说明记忆补不齐推理。最后,这是 Maximem 自家产品的架构说明,动机和实现都围着 Maximem Synap 转,读的时候要把方法论启发和产品宣传分开。