Compact-Memory LLM Agents via Online Max-Member Clustering and Atom-Aware Packing
Jiahe Geng, Jinpeng Wang, Kun Yuan
cs.AI
2026-09-04
RSM-full给长程智能体做在线聚类记忆:写入用max-member合并,读出按原子分组打包。AMA-Bench四千预算达到全上下文八成三质量、三成二token,比Online K-Means高三点五到六分。
长程agent不能把对话全塞进提示词:延迟、费用和窗口都会爆。固定窗口或top-k检索能卡住长度,却常把可复用的潜在结构剪掉。问题从「能不能回忆」变成:在大约2k–5k token的紧预算里,哪种记忆设计的质量–token比最好。
和ACON、MemGPT这类「压缩什么、总结什么」的系统不同,这篇把范围收在向量索引和拼提示这一层:流式记忆怎么合并、取回来的片段怎么组装。
RSM-full两条核心规则,更高阶的基向量存储和量化放进附录。
写入是余弦门控的max-member合并。新chunk找余弦最大的原子(簇),若它和簇均值或簇内任一成员的余弦达到阈值τ就并入,否则开新原子。比只看质心更松,相似片段不容易因为均值被冲淡而拆簇。τ按嵌入空间在至多50条未标注验证上取成对余弦的约70分位,AMA/BGE上是0.85。
读出是原子感知的分组打包。先取top-K原子,原子内再排序,按原子带头、时间序写入提示,而不是把所有chunk摊成一条相关性列表。检索可以用簇的第一奇异向量或归一化质心;在BGE归一化的AMA上,两者一旦固定打包方式,差异不显著。
AMA主设置:chunkturns=5, retrievek=6, k=8,预算约4k,agent是GPT-4o-mini。
AMA-Bench 208个episode、2496条QA。约4k预算下RSM-full均分0.311,全上下文0.373、12519 token,相当于83%质量、32% token。Budget-RAG 0.292,Streaming-Proto 0.302,Online K-Means 0.281,复现的A-MEM 0.273。四种子、三个预算(2.6k/4k/5k)上相对K-Means分别+3.65/+3.50/+6.04,全部p<.001。
| 方法 | 均分 | Token | 相对全上下文 |
| Full-Context | 0.373 | 12,519 | 100% |
| RSM-full | 0.311 | 4,001 | 83%质量 / 32% token |
| Streaming-Proto | 0.302 | 3,982 | 无 |
| Budget-RAG | 0.292 | 4,146 | 无 |
| Online K-Means | 0.281 | 4,000 | 无 |
| A-MEM | 0.273 | 4.2k | 无 |
2×3析因把增益拆开。打包方式固定时,max-member合并相对K-Means +5.74、相对同τ的DP-means +5.45。检索规则A–D对比p=0.40,可以忽略。聚类和检索固定时,分组打包相对扁平拼接+5.02±1.00。给K-Means也用上同一打包器,RSM仍高4.90。
RealMem(10个人格、约1415条QA)复现了同一方向:RSM-full 0.4684,相对Budget-RAG +0.69(p=0.006),相对A-MEM +1.65,相对Streaming-Proto +2.97;和BM25-RAG的+0.27不显著,作者明确不声称等价。效应比AMA小,和这篇更偏词法线索、原子结构更弱一致。
紧预算下,记忆系统的第一刀不在更花哨的LLM整理,而在合并规则和提示拼装。两条都是向量索引层的小改动,却各自贡献约5个点。4k上下、对话里有重复结构时,这是一个明确的Pareto点;超过大约12k token,全量或词法检索仍然更强。
部署上int8变体在AMA上和float32差不多(0.315 vs 0.311),附录里的高阶存储是跨几何的后路,不是主结果的原因。
作者把正面结论收在AMA-Bench和RealMem。原始LoCoMo和LongMemEval是边界:纯稠密检索弱于BM25,RSM-full退化到质心等价,紧凑记忆优势会消失。v1检索只在LoCoMo-Plus四类关系里的两类上激活,不能当通解。
没有选择性遗忘。嵌入和主评判各用一套(BGE + GPT-5.4 rejudge),换嵌入没做。AMA-Long在N=32k时所有方法都贴着无记忆天花板,长程消融只说明簇数,不说明答题质量。MemGPT/MemoryBank在RealMem上落到无记忆以下,作者自己标了复现问题,不宜当方法上限来打。