清华等揭示混合注意力模型激活值「跨层痕迹」

机器之心 · wechat · 2026-09-01

来自 StartLux、清华大学等机构的研究者通过探针「MassiveActivations」,首次系统刻画了混合线性注意力大模型(HLALLM)中少数 FullAttention 层留下的「跨层痕迹」。

核心发现:尖峰与平台

机制解释:写入—汇聚—消除

研究提出了一个三阶段生命周期来解释这一现象:

广泛验证

该规律在 KimiLinear、Qwen3.5、Nemotron-H 等公开模型(1.2B-397B)中得到验证,且在训练早期便已形成。研究指出,FullAttention 的排布是内部计算节奏的「组织者」,这对模型压缩与量化提供了新线索。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →