滑动窗口注意力完胜后训练线性注意力
jm_alexia · x · 2026-08-31
新论文证明,带有 attention sinks 的滑动窗口注意力(SWA)在无需任何成本的情况下,性能优于后训练的线性注意力模型。在长上下文推理任务中,SWA 性能比线性注意力高 2-10 倍。SWA 无需后训练、速度快且内存占用低,作者强烈建议使用 SWA 替代线性注意力模型来降低推理内存成本。
所属事件:研究:滑动窗口注意力击败后训练线性注意力(4 条相关)→
「研究」频道最新
- RL 专家惊讶于 Agent 互监失效:未耗尽 Token 却自愿自我毁灭 — ZeroStateReflex · 2026-08-31
- 里程碑:pLM 设计的肽在活体小鼠中成功降解致病蛋白 — arjunrajlab · 2026-08-31
- 快速 Sim2Real 训练流:手机端策略查看与参数扫描 — yacineMTB · 2026-08-31
- 二元数据评估首选 Wilcoxon 符号秩检验 — IanArawjo · 2026-08-31
- François Chollet 回应 ARC-AGI 评测争议:勿宣称未跑分成绩 — fchollet · 2026-08-31
- 研究复盘:线性注意力未生效的发现 — jm_alexia · 2026-08-31