微软论文:滑动窗注意力无需训练即可省显存

rohanpaul_ai · x · 2026-09-02

微软新论文指出,若目标是降低推理显存,无需训练的滑动窗注意力(Sliding Window Attention, SWA)效果优于大多数线性注意力方法。

核心方法:仅保留一小部分最近窗口,加上模型依赖的前 4 个“sink” token。

主要表现:

结论:虽然全注意力在长上下文中仍表现最佳,但在固定低内存且不重新训练的情况下,建议优先尝试带 attention sinks 的 SWA。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →