近期LLM在SWA层采用不同KV头数配置

开发者指出近期多项大模型工作存在一个关键实现细节:在滑动窗口注意力(SWA)层中使用的 KV heads 数量会高于全局层。除了作者自身的 SDM 模型外,包括 Gemma 4、step 3.5 等在内的多项研究也确认采用了这种 SWA 层与全局层配置不同 KV 头数的做法。

2026-07-16 ~ 2026-07-16 · 2 条相关