Agent 上下文每轮累加,token 成本 O(n²) 爆炸,这篇拆出五个生命周期原语

Agentic Context Management: Solving Agent Memory and Cost by Treating Them as Lifecycle and Architecture Problems

Gaurav Dadhich

cs.AI, cs.IR

2026-07-24

论文把生产 Agent 的上下文管理提成五原语生命周期,指出每轮全量累加成本 O(n²),校验压缩可做到 O(n) 且不损准确率。

这篇在解决什么

生产环境的 AI agent 用着用着就「失忆」:跨会话记不住、交接时自相矛盾、上下文塞满后开始幻觉,而且每多一轮对话,token 账单就涨一截。作者的核心判断是,这些故障很少因为模型不会推理,更多因为它管不住自己脑子里该装什么。常见的解法把记忆当成「存与取」的存储问题,作者认为这个框太小。决定该记住什么、提取并结构化、按数据类型选存储、合并与遗忘同时保留来源、判断当下什么相关、预判接下来需要什么、在预算内压缩而不丢关键信息,这些动作横跨一个完整的生命周期,存储只是其中两个时刻。

方法

作者把这个领域命名为 Agentic Context Management(ACM,智能体上下文管理),拆成五个原语:

参考实现 Maximem Synap 有几个设计选择:摄入异步(先返回 ID,后台处理),压缩返回显式校验分、不过就自动重试,身份从凭证推导而非客户端自报,检索是向量相似度加图遍历的混合。

结果

成本论证是这篇最硬的部分。朴素地把每轮全量拼进上下文,累积 token 成本是 C = t·n(n+1)/2,即 O(n²);把每轮预算限在 W,成本变 n·W,即 O(n)。设每轮 500 token、预算 4000,50 轮时全量法已是预算法的 3.2 倍,500 轮时 31.3 倍。

三种路线对比:

路线成本保真度失败模式
全量累加O(n²)满,直到上下文腐烂成本爆炸
粗暴摘要O(n)有损、不校验准确率悬崖
校验压缩O(n)保留并校验目标:无

作者引了一个例子:把 18,282 token 压到 122,准确率从 66.7% 掉到 57.1%,比没有上下文还差。基准上,LongMemEval 全 500 题用 gpt-5-mini 做答案和判官,总分 92.0%;LoCoMo 第 1-4 类 93.2%。对比是 SuperMemory 约 85%、Zep 71.2%,但作者自己标明这是各家按自己方法自报,不是受控比较。

为什么重要

对做 agent 的人来说,这篇的价值在两块。一是把「上下文失控」这件事从工程杂活提成了一门有结构的学问,五个原语给了一张可以照着自查的清单:你现在的系统有没有实体消歧?有没有跨用户隔离?压缩有没有校验?二是 O(n²) 这个账算得清楚,长对话的 token 成本不是线性涨,是平方涨,这对成本敏感的生产场景是真问题。校验压缩这个方向比单纯摘要更可信。

局限与存疑

这篇的弱点要直说。基准只测召回(accuracy),不测延迟、token 效率、高负载下的上下文腐烂抗性,而这些恰恰是它标榜要解决的生产问题。LongMemEval 92.0% 这种高分很大程度上是 gpt-5-mini 加这套配置的结果,不是系统本身的抽象属性。对比表是自报、非受控,SuperMemory 用的是不同模型和判官,严格说比不了。最难的跨会话推理只有 75.2%,说明记忆补不齐推理。最后,这是 Maximem 自家产品的架构说明,动机和实现都围着 Maximem Synap 转,读的时候要把方法论启发和产品宣传分开。

术语

原文与代码

社区讨论

相关论文

全部论文解读