Kimi K3架构解析:引入块注意力残差与NoPE机制
nrehiew_ · x · 2026-07-29
继续深挖 Kimi K3 架构设计:模型采用了块注意力残差,将每 12 层分为一组。传统残差连接会导致信息丢失、后层影响过大及前层梯度失稳;新机制引入了可学习的注意力权重,并按块存储输出总和,大幅减少了激活重计算的开销。
在注意力机制上,K3 复用了 Kimi Linear 的 Delta Attention (KDA),其更新规则隐式包含了位置表示,因此可以直接抛弃 RoPE 位置编码。在 3:1 比例混合的 KDA 与 MLA 层中均使用了 NoPE,仅在 MLA 的输出投影上增加了一个依赖输入的门控。
所属事件:Kimi K3 技术报告披露训练与系统细节(19 条相关)→
「研究」频道最新
- 小模型编排在 100 题任务中把完成率大致翻倍 — _raydeStar · 2026-07-29
- 一个 AI 摘要系统每周扫描 92 个期刊并生成 RSS — Afinetheorem · 2026-07-29
- 一个每周更新的 PDB 排行榜追踪开源 cofolding 模型 — rishabh16_ · 2026-07-29
- Agentic AI 峰会设机器人与世界模型专场 — dawnsongtweets · 2026-07-29
- 新指南指出,系统性文献综述里 GenAI 仍需要人工监督 — DrDatta_AIIMS · 2026-07-29
- Wharton 实验室开源 AIBO,用于统计有效的 AI 行为实验 — emollick · 2026-07-29