研究者讨论现代 LLM 的 1/d 注意力缩放
7 月 16 日,多位研究者围绕现代 LLM 注意力机制中的缩放规律展开讨论,焦点是:在一些实现里,attention 可能更接近 1/d,而不是大家熟悉的按 sqrt(dhead) 处理。这一话题之所以值得关注,在于它直指多头注意力的参数化与归一化细节,可能影响人们对现有架构行为的理解。不过,这一轮讨论仍以技术推断为主,并未形成定论。
关键细节
@stochasticchasm 提出,一个看起来较新的观察是:如果 QK norm 是按 head 计算,attention 里就可能出现 1/d 缩放。@SeunghyunSEO7 进一步表示,很多 LLM 现在会直接对 qproj(x) 做 qnorm,因此每个 head 的 q/k 向量不一定再按 sqrt(dhead) 去缩放;在这一语境下,1/dhead 的思路被认为与这类实现方式有关。
其他解释与实验线索
@rishiiyer01 给出另一条解释路径,认为 1/d 缩放也可能与 μP 的 scaling factor 有关,同时补充每个 head 的 qk norm 也许仍是相关因素。另一个回复里,@SeunghyunSEO7 说自己受 Alec 的架构启发,加入 head gain、activation gain 以及 embedding residual/skip connection 后观察到性能提升。帖文没有提供完整实验细节,因此这更像是对“按 head 的参数化和增益设计可能影响表现”的初步旁证。
争议与存疑
整体来看,这不是一次产品或模型发布,而是一次偏研究性质的技术讨论。现有帖子提出了若干可能机制,但尚不足以证明现代注意力到底应被概括为哪一种统一缩放规律。
2026-07-16 ~ 2026-07-16 · 6 条相关
一手来源
- 关于注意力 1/d 缩放的观察 — stochasticchasm ·
- 多头注意力缩放与per-head gain — SeunghyunSEO7 ·
- 注意力 1/d 缩放的新解释 — rishiiyer01 ·
- 【源头】关于注意力 1/d 缩放的观察 — stochasticchasm · 2026-07-16
- 讨论注意力的1/d缩放新颖性 — stochasticchasm · 2026-07-16
- 【源头】注意力 1/d 缩放的新解释 — rishiiyer01 · 2026-07-16
- 【源头】多头注意力缩放与per-head gain — SeunghyunSEO7 · 2026-07-16
- 可学习增益参数提升模型表现 — SeunghyunSEO7 · 2026-07-16
另有 1 条近重复转述:stochasticchasm