微软论文:滑动窗注意力无需训练即可省显存
rohanpaul_ai · x · 2026-09-02
微软新论文指出,若目标是降低推理显存,无需训练的滑动窗注意力(Sliding Window Attention, SWA)效果优于大多数线性注意力方法。
核心方法:仅保留一小部分最近窗口,加上模型依赖的前 4 个“sink” token。
主要表现:
- 在 11 个模型的 9 个对比中,64-token 窗口的 SWA 拿到了最佳下游平均分,恢复了全注意力基线 99.0% 的平均性能。
- 在长语境推理上优势扩大:在 4K 上下文的 Needle-in-a-Haystack 任务中,SWA 达到 17.2%–23.0%,而 LoLCATs 仅为 5.8%;在 BABILong 上,SWA 得分 15% 对比 3%。
- 速度与内存测试中,64-token SWA 配置最快且显存占用最低。
结论:虽然全注意力在长上下文中仍表现最佳,但在固定低内存且不重新训练的情况下,建议优先尝试带 attention sinks 的 SWA。
「研究」频道最新
- 开发决策只记结果不记理由,这合理吗? — Sea-Perception1619 · 2026-09-02
- Schmidhuber 团队称线性Transformer复刻早期成果 — SchmidhuberAI · 2026-09-02
- 新理论:递归临界数决定 AI 自我改进是否爆发 — Mikhail Burtsev · 2026-09-02
- AndroidWorld 揭秘:为何手机 Agent 基准测不准? — East-Muffin-6472 · 2026-09-02
- Bregman 散度与指数族的对偶性统一 — FrnkNlsn · 2026-09-02
- 新论文提出递归 Transformer:层参数共享压缩模型 — max_paperclips · 2026-09-02