Kimi K2 架构解析:KDA 与 Gated MLA 混合及遗忘门机制
suchenzang · x · 2026-07-28
作者分析了 Kimi K2 的注意力扩展机制,指出其混合了局部 KDA(Kimi Delta Attn)与全局 Gated MLA(Deepseek V2),比例为 3:1。KDA 受到 qk-norm 约束,而通道级的衰减被构建为“遗忘门”,起到类似权重衰减的作用以限制动态范围。
「研究」频道最新
- 作者称 KDA 低秩 gate 不能解决 attention sink — stochasticchasm · 2026-07-28
- Kimi K3 把 KDA gate 改成全秩,低秩被指没解决 attention sink — suchenzang · 2026-07-28
- 斯坦福用 AI 扫描 5 亿词州法,帮政府清理冗余条文 — StanfordHAI · 2026-07-28
- Kimi K3 报告提出 SiTU-GLU:可控上界的门控近似 SwiGLU — stochasticchasm · 2026-07-28
- Kimi K3 的 MoE 路由可能推高专家并行通信 — stochasticchasm · 2026-07-28
- Kimi K3 发现 16 个新漏洞并领先 GLM-5.2 — zephyr_z9 · 2026-07-28