滑窗注意力击败线性注意力:长文本推理成绩高出 2 到 10 倍
s_scardapane · x · 2026-09-14
Mila 研究员 Alexia Jolicoeur-Martineau 等人的 arXiv 论文比较了后训练线性注意力与更简单的基线,结论出人意料:
- 带 sinks 的滑窗注意力(SWA)在多个 LLM 和多种下游任务上表现与后训练线性注意力模型持平或更好
- 长上下文推理任务(Needle-in-a-Haystack、BABILong)上,SWA 成绩高出线性注意力 2 到 10 倍
- SWA 无需后训练、速度极快、内存占用低,是极廉价可靠的方案
- 作者强烈建议:为降低推理内存成本,应直接改用 SWA 而非后训练线性模型;线性注意力若要追平 SWA,可能需要从头训练或大量后训练
「研究」频道最新
- Old School RuneScape 被搬进 PufferLib 5.0,成强化学习训练环境 — neuroecology · 2026-09-15
- 倒着造谜题:滑铁卢大学发布 2 万题 ORBIT 数据集训练搜索 agent — CShorten30 · 2026-09-15
- 二倍体感知的基因组语言模型发布:多数模型训练用的基因组并不真实存在 — OdedRechavi · 2026-09-15
- 4000 次实测:96 个工具只掉 9 分,agent 第三轮才是真瓶颈 — EastVersion1226 · 2026-09-15
- 层丛上同调视角解析预测编码网络:Hodge 分解揭示学习何时停滞 — burny_tech · 2026-09-15
- 表格基础模型学习路径:从 Molnar 开源书到 nanoTabPFN 实践 — pandeyparul · 2026-09-15