首个混合线性注意力系统研究:揭示全注意力层前后激活尖峰规律
jiqizhixin · x · 2026-09-10
StartLux、清华、国科大、港大、悉尼大学与哥伦比亚大学联合发布首个针对混合线性注意力(HLA)模型的系统性研究,覆盖 5 种线性注意力架构、6 种混合配置、5 个数据域、12 个公开 checkpoint,参数规模 1.2B 到 397B(涉及 Qwen3.5、Kimi Linear、Nemotron-H、Zamba 等)。
研究以 Massive Activations(大值激活)为探针,发现两个核心现象:
- Pre-Attention Spikes(PAS):激活值在全注意力层之前的前一层骤升至峰值,如同主角登场前的观众欢呼;
- Inter-Spike Plateaus(ISP):相邻尖峰之间存在持续高激活区域。
这项工作首次系统刻画了少量全注意力层如何重塑混合模型内部的计算行为。
「研究」频道最新
- Turing 发布 CEO Bench:500+ 任务模拟公司里考核前沿 Agent — ecekamar · 2026-09-10
- 学者吐槽 AI 时代学术激励:拿粗想法喂模型抢发论文竟无成本 — erikphoel · 2026-09-10
- SpeechLM 被发现在中间层隐式转写语音,入选 EMNLP 2026 Findings — kastnerkyle · 2026-09-10
- 41.5万小时全双工对话语音数据集发布,训练口语对话模型 — kastnerkyle · 2026-09-10
- NAVER AI Lab 论文:重审完整推理轨迹在后训练中的作用 — kastnerkyle · 2026-09-10
- 量子传感器团队用 GPT-5.6 Pro 做伽罗瓦逆问题研究,IGP24 排名第 14 — paulfinneyx · 2026-09-10