滑动窗口注意力完胜后训练线性注意力

jm_alexia · x · 2026-08-31

新论文证明,带有 attention sinks 的滑动窗口注意力(SWA)在无需任何成本的情况下,性能优于后训练的线性注意力模型。在长上下文推理任务中,SWA 性能比线性注意力高 2-10 倍。SWA 无需后训练、速度快且内存占用低,作者强烈建议使用 SWA 替代线性注意力模型来降低推理内存成本。

所属事件:研究:滑动窗口注意力击败后训练线性注意力(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →