记忆从副产品变成大模型的独立维度:这篇综述用三条正交轴统一 attention 与 SSM

Memory for Large Language Models

Sining Zhoubian, Dan Zhang, Evgeny Kharlamov, Jie Tang

cs.CL

2026-07-28

沿表征、更新动态、持续性三条正交轴给大模型记忆分类,统一了 attention、SSM、外部检索库这些各说各话的机制,并归纳六种混合架构与多维评测方法。

这篇在解决什么

memory 已经成了大模型架构里一个独立的维度。它不再只是前向计算顺带产生的副产品,而是一整套可以被显式控制、读写、更新的机制:attention 的 KV cache、RNN/SSM 的隐状态、test-time training 更新的参数、外部检索库,都被装进「记忆」这个框架。

问题是这片地长得太快、太碎。Titans、TTT、Mamba、kNN-LM 以及一堆 hybrid 架构各自为政,用的词都对不上:有的把 KV cache 叫 memory,有的只认外部数据库才算。没有统一语言,就很难说清一种新方法到底新在哪、跟旧方法什么关系。这篇综述要做的就是给这片混乱画一张共通的地图。

方法

作者提出一个以架构为中心的分类法,沿三条正交的轴定位任何一种记忆机制。

三条轴基本正交:显式记忆可以离线也可以在线,在线记忆可以是短期也可以是长期。把这三者解耦,既有的各种方法就能被放进同一个设计空间里比较。

在这三条轴之外,作者又归纳了一组更细的更新规则,刻画记忆在拿到一次更新机会后到底怎么变:基于优化的写入(TTT、Titans,靠显式目标更新参数)、状态转移(Mamba、Gated DeltaNet,用学到的转移方程推隐状态)、信号门控(用惊讶度、不确定性或预测误差决定写不写)、准入与淘汰(决定哪些条目进、留、压缩、丢),以及由辅助目标诱导的更新。

范围要说清:这篇只覆盖模型架构层面的记忆,不含预训练得到的静态权重,也不含 agent 层面、靠外部 prompt 编排的记忆系统。它的定位是补全,而非替代那些以系统或认知为中心的综述。

结果

分类法本身的产出,是把散落的机制理成几条清晰的脉络。

隐式记忆这边,作者梳理了基于 attention 的(KV cache、稀疏与滑动窗口 attention、MoBA、NSA 等选择性 attention)和循环式的(Mamba 系列、RWKV-7、Gated Delta Networks、Kalman Linear Attention)。显式记忆这边分参数化模块(Titans、TTT-E2E、MEMORYLLM、LM2)和查表式(kNN-LM、Engram、PlugLM),还有 MoE 这种靠路由做的稀疏记忆。

最有价值的部分是 hybrid 架构的归纳,作者总结了六种混合模式:attention 与结构化状态层交错(Jamba、Samba)、自适应记忆路由(AMOR 用熵门控)、隐式记忆配显式存储、多时间尺度混合、多模块组合(Hydra 把 SSM 和 MoE 拼在一起),以及 HAM 这种用惊讶度门控的 KV-RNN 混合。这部分把「大家各拼各的」收敛成可复用的设计模式。

评测方面,作者主张要按多维度评:长上下文检索(RULER、LongBench、∞Bench)、跨长上下文的结构化依赖推理、遗忘与干扰(stability-plasticity 权衡)、效率与能力的取舍,以及隐式对显式的统一比较。言下之意是,现在很多评测只盯长上下文召回,会漏掉遗忘、干扰这些记忆独有的失败方式。

为什么重要

对做模型架构的人,这张图直接降低了进入成本:再看到一种新的 memory 机制,可以立刻按三条轴定位它,知道它跟 Titans、Mamba、kNN-LM 是同构还是互补,而不是当成又一个全新发明。hybrid 那六种模式尤其实用,基本覆盖了当下把 attention 和 SSM 拼起来的主流做法。

对应用侧,这篇帮你看懂一个趋势:长上下文的解法正在从「把窗口开大」转向「让模型自己管理记忆」,显式、在线、长期的记忆机制是当前的前沿。挑模型或设计系统时,先想清楚自己要的记忆落在三条轴的哪一格,再去对号入座。

局限与存疑

这是综述,不引入新方法也不做新实验,所有判断都靠对已有工作的归纳,免不了带作者视角的取舍:哪些算 hybrid、哪些归到哪条轴,别家未必认同。范围刻意收窄到模型层,agent 记忆和 RAG 这类工程上最常用的方案被排除在外,对做应用的人来说覆盖面会显得不够。分类法本身也还在演化:作者自己提了更新规则这层,但承认它不是第四条主轴,只是三条轴内部的细化,边界仍有讨论空间。

术语

原文与代码

社区讨论

相关论文

全部论文解读