前两层为何只用滑动窗口注意力?架构设计引发技术猜想
stochasticchasm · x · 2026-09-11
有人注意到某 20 层模型中前两层仅使用滑动窗口注意力(SWA),并对其设计动机展开技术讨论。
- 疑问:20 层中只有 2 层用 SWA,对 prefill FLOPs 的节省似乎不大,但越少全局注意力确实越便宜,背后可能有故事,类似 MoE 的 first-k-dense 设计。
- 关于 cross attention:只 attend 编码器的 KV 应该是消融实验的候选之一;有趣的是 decoder 能在自身序列上下文中直接 attend 到编码器的 hidden states,似乎是好选择,思路类似 MoDA 这种允许引用更早层 KV 的设计。
所属事件:推理优先新架构引热议:FP4 KV cache 与纯 CSA2 压缩成焦点(11 条相关)→
「研究」频道最新
- RD-Forget:让 Agent 记忆"可逆遗忘",过期事实不污染回答 — MaryamMiradi · 2026-09-11
- 《科学·进展》编辑:从未见过作者披露 AI 使用 — TuhinChakr · 2026-09-11
- NVIDIA BioNeMo 推理运行时开公测:CUDA 内核加速蛋白质结构预测 — AllThingsApx · 2026-09-11
- NVIDIA 开源 BioNeMo 推理运行时,蛋白结构预测吞吐提升 2.9 倍 — AllThingsApx · 2026-09-11
- NVIDIA BioNeMo 推理运行时开启公测,Boltz-2 等模型推理提速 — AllThingsApx · 2026-09-11
- PARSER 拆解长文阅读:子代理并行分块,主代理散射聚合推理 — omarsar0 · 2026-09-11