Kimi K2 架构解析:KDA 与 Gated MLA 混合及遗忘门机制
suchenzang · x · 2026-07-28
作者分析了 Kimi K2 的注意力扩展机制,指出其混合了局部 KDA(Kimi Delta Attn)与全局 Gated MLA(Deepseek V2),比例为 3:1。KDA 受到 qk-norm 约束,而通道级的衰减被构建为“遗忘门”,起到类似权重衰减的作用以限制动态范围。
「研究」频道最新
- 新论文 PFD 统一解释 SDS 模式坍缩,蒸馏收敛更快方差更低 — burny_tech · 2026-09-23
- 基因组语言模型 Minerva 发现新型 ncRNA 阵列,助力生物发现 — BrianHie · 2026-09-23
- OfirPress 质疑新榜单算法:子集挑题+平均通过率,掩盖任务真实完成度 — OfirPress · 2026-09-23
- 剑桥出版高维统计新教科书,Samworth 与 Shah 合著免费开放 — FrnkNlsn · 2026-09-23
- Reinforce-Ada:按难度自适应分配算力,RLVR 收敛加速至 2 倍 — burny_tech · 2026-09-23
- 论文:Transformer 并非没有世界模型,而是特征叠加互相干扰 — burny_tech · 2026-09-23