前两层为何只用滑动窗口注意力?架构设计引发技术猜想

stochasticchasm · x · 2026-09-11

有人注意到某 20 层模型中前两层仅使用滑动窗口注意力(SWA),并对其设计动机展开技术讨论。

所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →