一文讲透自注意力:为何除以 √d_k、权重为何非参数
techNmak · x · 2026-09-21
一篇面向工程师的自注意力机制教学长文,从矩阵推导到设计动机逐层讲清:
- 基本形式:对隐状态矩阵 X 做三个可学习投影 Q=XWQ、K=XWK、V=XWV;位置 i 的 query 与所有 key 做点积得到注意力分数,除以 √dk 后按行 softmax。
- 为何除以 √dk:维度增大时点积幅度变大,会推动 softmax 进入饱和的小梯度区域;缩放让分数保持在有效范围。
- Q/K 与 V 的分工:query 和 key 决定权重,value 是被加权组合的向量,输出 zi 是多个 value 向量的加权混合,而非「选一个 token 复制」。
- 权重不是参数:投影矩阵是学习的,但注意力权重由当前激活动态计算——换序列,注意力矩阵随之变化。
- 因果掩码:causal self-attention 在 softmax 前屏蔽后文位置,权重置零。
- 多头注意力:多组不同投影并行计算,输出拼接后过输出投影。
全文收束到单行公式 Attention(Q,K,V) = softmax(QK^T/√dk)V:每个位置计算的是输入相关的 value 加权组合。
「研究」频道最新
- 腾讯开源 T-Mem 记忆架构:写入时预判未来用途,关联回忆强 28pp — aigclink · 2026-09-21
- Nature 综述:LLM 当人类代理有四种角色,各自需不同有效性标准 — iyadrahwan · 2026-09-21
- 当 AI 能证明人类看不懂的定理,数学还剩下什么 — ugail · 2026-09-21
- GuardianAgent 论文:让 AI Agent 实时反击网页追踪 — flosalim · 2026-09-21
- ECDYSIS 论文:Agent 运行时该按失败模式而非次数来修 — rohanpaul_ai · 2026-09-21
- Light-O1 发布:靠人类视频预训练驱动不同人形机器人做家务 — haukejung · 2026-09-21