Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus
Zunhai Su, Bohan Sun, Xialie Zhuang, Shuibai Zhang, He Xiao, Jing Xiong, Hengyuan Zhang, Zhongzhu Zhou, Tiantian Zhang, Ngai Wong, Chuan-Wei Kuo
cs.CL
2026-08-12
混合线性注意力大模型里,大值激活总在全注意力层前骤增,全注意力越密集越连成平台,1.2B到397B模型上普遍成立。
Qwen3-Next、Qwen3.5、Kimi Linear这类模型现在流行把线性注意力层和全注意力层交替堆叠,用线性注意力省计算量,靠穿插的全注意力层保住建模能力。但这种混合架构内部的激活值到底怎么分布,此前没人系统研究过。已知全注意力Transformer里存在大值激活(Massive Activations,简称MA)——极少数token在某些维度上的激活值比正常值大好几个数量级,并且和注意力汇聚(attention sink,模型把大量注意力权重固定分配给某个token,通常是首token)现象紧密绑定。这篇论文问:混合架构里这些大值激活还长这样吗,还是被线性注意力层重新组织了?
先解决一个工程问题:全注意力模型里,哪个token激活值最大和哪个token是注意力汇聚点高度重合,直接按激活值大小找MA就够了。但混合模型里这两者经常对不上——论文测出,在1.3B的混合模型里,最大激活值token和注意力汇聚token的重合率远低于纯Transformer,而且相邻层里哪个token激活最大这件事本身还会频繁跳变。于是论文改用共识注意力汇聚(跨全注意力层、跨注意力头统计出的稳定汇聚token)作为锚点,固定追踪这个token的激活值随深度的变化,而不是每层重新找最大值token。
用这套方法在五种线性注意力架构(RetNet、HGRN、GLA、DeltaNet、GDN)、多种混合比例(每几层线性注意力配一层全注意力)上追踪,发现两个规律:一是预注意力尖峰(Pre-Attention Spike,PAS),汇聚token的激活值在每个全注意力层前骤然升高;二是尖峰间平台(Inter-Spike Plateau,ISP),当全注意力层排得更密时,相邻两个PAS之间的激活值不再回落,连成一片持续偏高的区域。全注意力层排得越密,ISP越明显,最终在纯全注意力模型(即混合比例1:1)那里,PAS和ISP完全融合成全层稳定偏高的经典MA形态。
在M-A-P套件(五种架构×340M/1.3B两个规模)上,PAS的汇聚点与尖峰的对齐率在几乎所有架构规模组合里都接近或等于100%:
| 架构 | 1.3B对齐率 | 340M对齐率 |
| HGRN | 100.0% | 100.0% |
| GDN | 100.0% | 100.0% |
| RetNet | 99.9% | 100.0% |
ISP的尖峰间保留率随全注意力密度单调上升,例如GDN架构下,12:1混合比例(全注意力很稀疏)时1.3B模型的保留率只有18.4%,3:1(全注意力更密)时升到77.8%。在12个公开大模型(Kimi Linear、Qwen3.5、Nemotron-H、Zamba2,参数量1.2B到397B)上复测,同样的PAS/ISP结构都出现,且在Base和Instruct两个后训练阶段的Kimi Linear模型上位置基本不变,只是幅度不同。受控预训练进一步显示:给全注意力层加输出门控能明显压低PAS/ISP的幅度(但不能消除),而去掉GDN自身的门控只带来中等程度的放大,说明全注意力层在组织这套激活结构上起的作用更主导。
对做混合架构模型量化、剪枝或KV-cache优化的工程师,这篇给出一个明确的信号:大值激活在混合模型里不是均匀分布的,而是集中在全注意力层前那几个token位置,并且这个位置随全注意力层的排布可预测地移动。做低比特量化时如果沿用纯Transformer的逐层统一处理离群值的经验,大概率会在这些预注意力位置上出问题,需要按层类型区别对待。论文提出的写入-汇聚-抵消机制解释也给后续设计输出门控、outlier-aware量化方案提供了一个可操作的靶点,门控应该重点作用在全注意力层附近,而不是均匀撒在整个网络上。
这套解释目前停留在现象描述和相关性证据层面,论文承认什么因素决定抵消发生的快慢仍是未解问题,PAS到ISP之间的转换机制没有给出可以直接操控的旋钮。受控预训练实验只做到1.3B规模,而实际验证用的开源模型最大到397B,这两部分证据之间存在规模上的断层,论文没有在更大规模上做受控预训练来确认早期发现的PAS/ISP训练早期即出现是否在大规模下依然成立。此外论文的功能性影响,这两种激活形态到底对模型的哪些能力(比如长上下文召回)起作用,完全没有测试,纯粹是激活层面的观察,没有连到下游任务表现。