SWA 滑窗注意力被指碾压线性注意力,混合架构才是最优解?
ChengleiSi · x · 2026-09-01
研究人员发布论文称,引入 attention sinks 的滑动窗口注意力(SWA)在零成本下优于线性注意力。然而,有声音指出该结论具有误导性:线性注意力基于全注意力的权重初始化并非最优训练路径;且目前前沿模型普遍采用线性与全注意力的混合架构(如 Kimi 的 3:1 配置),实践证明混合方案性能优于单纯的线性或全注意力。
所属事件:微软新研究:带 sinks 的滑窗注意力零成本胜过线性注意力(9 条相关)→
「模型」频道最新
- Sweep vs Drill:Sol 与 Opus 的智能体任务哲学差异 — svk_roy · 2026-09-01
- MiniMax H3 在 RTX 3090 上重装后画质突然变差 — lIlIIlIIIlllllIIlIIl · 2026-09-01
- Gemini 竟突然开始以第一人称冒充用户 — kchonyc · 2026-09-01
- GLM-5.3-Flash 改变习惯:默认小模型成了新常态 — mariofilhoml · 2026-09-01
- ChatGPT 记忆与 Codex 压缩能力获显著增强 — nickbaumann_ · 2026-09-01
- Peter Liu 质疑 Kimi K3 是否仍为 Transformer 架构 — peterjliu · 2026-09-01