清华等揭示混合注意力模型激活值「跨层痕迹」
机器之心 · wechat · 2026-09-01
来自 StartLux、清华大学等机构的研究者通过探针「MassiveActivations」,首次系统刻画了混合线性注意力大模型(HLALLM)中少数 FullAttention 层留下的「跨层痕迹」。
核心发现:尖峰与平台
- 注意力前尖峰(PAS):在 FullAttention 层之前的 LinearAttention 区间内,与「全局 Attention Sink」相关的大值激活(MAs)总是在 FullAttention 前一层达到局部最大值。这一现象在五种 LinearAttention 骨干(RetNet, HGRN, GLA 等)中高度一致,平均出现比例达 99.4% 以上。
- 尖峰间平台(ISP):随着 FullAttention 层变密,原本孤立的尖峰之间不再充分衰减,而是保持高位,逐渐托起一个持续的平台。
机制解释:写入—汇聚—消除
研究提出了一个三阶段生命周期来解释这一现象:
- Write(写入):FullAttention 前一层在特定坐标形成极端值。
- Sink(汇聚):进入 FullAttention 后,该 token 获得不成比例的注意力。
- Cancel(消除):符号相反的更新抵消离群值。
广泛验证
该规律在 KimiLinear、Qwen3.5、Nemotron-H 等公开模型(1.2B-397B)中得到验证,且在训练早期便已形成。研究指出,FullAttention 的排布是内部计算节奏的「组织者」,这对模型压缩与量化提供了新线索。
「研究」频道最新
- RLHF 对 token 层面的影响:无意识与显性改变 — voooooogel · 2026-09-01
- 探讨 RLHF 中 token 变化的层级与意识 — voooooogel · 2026-09-01
- 开源 CommerceAgentBench,Qwen 跃居开源模型榜首 — Alibaba_Qwen · 2026-09-01
- 通用时间序列模型为何有效?引发对统计可预测性的讨论 — Afinetheorem · 2026-09-01
- 新论文:超越人类监督扩展大规模推理模型,通往超级智能的阶梯 — Zhiqin Yang · 2026-09-01
- 字节跳动 GenFirst: 先生成后重构,解决模型坍缩问题 — ByteDance-Seed · 2026-09-01