滑动窗口注意力+Attention Sinks 免训练击败线性注意力
Alexia Jolicoeur-Martineau 等人发布新论文,提出一个反直觉结论:在预训练的 softmax Transformer 上,只需把注意力后验修改为带 attention sinks 的滑动窗口注意力(SWA)掩码,零训练成本,性能即可优于将模型强行适配为线性注意力(Linear Attention)再进行后训练微调的方案。
已确认
- 该方法无需任何后训练步骤,且 attention sinks 是零成本添加的机制
- 在多个 LLM 与下游任务上,SWA 与线性注意力模型表现相当或更好
- 在长上下文推理任务(Needle-in-a-Haystack、BABILong)中,SWA 性能比线性注意力高出 210 倍
- SWA 推理速度快、内存占用低
为什么重要
- 该结果对“用线性注意力改造已有模型以降低推理成本”的技术路线构成直接挑战:一个几乎免费的掩码改动即可超越昂贵的后训练适配
- 低内存占用意味着内存受限环境(如本地部署 LLM)下的长上下文推理可行性显著提升
- attention sinks 与滑动窗口均为已有成熟技术,该组合的复现与应用门槛低,可能被推理框架快速采用
2026-08-31 ~ 2026-08-31 · 5 条相关
一手来源
- 滑动窗口注意力完胜后训练线性注意力 — jm_alexia ·
- 新研究:滑动窗口注意力+Attention Sinks 可替代二次方注意力 — woadwarrior ·
- 滑动窗口注意力在长语境任务优于线性注意力 — iScienceLuvr · 2026-08-31
- 新研究:简单滑动窗口机制击败线性注意力 — jm_alexia · 2026-08-31
- 【源头】新研究:滑动窗口注意力+Attention Sinks 可替代二次方注意力 — woadwarrior · 2026-08-31
- 研究:滑动窗口注意力战胜线性注意力 — jm_alexia · 2026-08-31
另有 1 条近重复转述:jm_alexia