Kimi K3架构解析:引入块注意力残差与NoPE机制

nrehiew_ · x · 2026-07-29

继续深挖 Kimi K3 架构设计:模型采用了块注意力残差,将每 12 层分为一组。传统残差连接会导致信息丢失、后层影响过大及前层梯度失稳;新机制引入了可学习的注意力权重,并按块存储输出总和,大幅减少了激活重计算的开销。

在注意力机制上,K3 复用了 Kimi Linear 的 Delta Attention (KDA),其更新规则隐式包含了位置表示,因此可以直接抛弃 RoPE 位置编码。在 3:1 比例混合的 KDA 与 MLA 层中均使用了 NoPE,仅在 MLA 的输出投影上增加了一个依赖输入的门控。

所属事件:Kimi K3 技术报告披露训练与系统细节(19 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →