研究称滑动窗口注意力长上下文性能碾压线性变体
Justgototheeffinmoon · reddit · 2026-09-01
一篇新发表的 arXiv 论文指出,带有 sinks 的滑动窗口注意力(SWA)在长上下文推理任务上的表现,优于实验室投入大量算力后训练得到的线性注意力变体。
核心发现
- 在 Needle-in-a-Haystack 和 BABILong 等基准测试中,SWA 的性能比线性注意力高出 2 到 10 倍。
- 现有的线性注意力研究可能选错了对比基线,并未与像 SWA 这样的简单方法进行 proper 比较。
优势与建议
- SWA 不需要后训练,运行速度快且内存占用低。
- 作者强烈建议转向使用 SWA 而非后训练的线性模型,因为后者若要匹配 SWA 性能,可能需要从头训练或大规模后训练。
所属事件:零成本滑窗注意力+sinks 击败后训练线性注意力(9 条相关)→
「研究」频道最新
- 陶哲轩发起众包优化常数仓库,Komlós 猜想已收录为 C_24 — IgorCarron · 2026-09-21
- Hugging Face 发布 tokenizers v1,性能比 v0.23 快数十倍 — art_zucker · 2026-09-21
- GLiNER2 用 schema 条件化编码器重做 NER,引 LLM 对比讨论 — SGmoze · 2026-09-21
- 把问题放到 prompt 开头,本地 Qwen 准确率 89%→100%,延迟降 5 倍 — Micha0827 · 2026-09-21
- Eidon AI 关闭前开源 9TB 第一人称家务视频数据集 — victormustar · 2026-09-21
- 新研究证明均匀/高斯扩散与 unmasking 并行生成能力存在二次方差距 — LucaAmb · 2026-09-21