Kimi K3 技术报告深度解读:架构与训练系统全面曝光
月之暗面最新发布的 Kimi K3 模型技术报告引发开发者对其底层架构与训练系统的深度拆解。报告显示,K3 通过引入全新的注意力机制、并行策略和均衡算法,成功突破了超大规模型的训练瓶颈,且在内部测试中展现出极强的工程实战能力,其技术透明度获得了开发者的高度评价。
已确认
- 模型架构创新:K3 引入了块注意力残差(每 12 层一组)与 NoPE 机制,并采用 KDA (Delta Attention)。为解决 MoE 负载均衡问题,K3 放弃了 DeepSeek V3 风格的无偏置辅助损失,转而采用“分位数均衡”机制,配合 LatentMoE 突破了 3T 规模瓶颈。
- 训练与底层优化:训练流程包含 SFT(使用 QAT,权重为 MXFP4,激活为 MXFP8)、RL 和 MOPD。并行策略采用了 PP、EP、Zero 2 和 CP,且首次将 ViT 纳入流水线图。团队在 DeepEP 之上开发了 MoonEP 以实现完美均衡,并设计了 FlashKDA 实现分块并行计算,通过切分为 16 个 token 的 tile 解决了数值不稳定问题。预训练部分据称借由 KDA 节省实现了 2.5 倍的 scaling 提升。
- 多模态与 RL 管线:K3 采用原生多模态设计,完全从头训练视觉编码器 MoonViT-V2(而非使用 SigLIP 初始化),以稳定多模态训练并提升视觉评测表现。RL 环境合成管线则利用 web search agents 搭建任务知识图谱并抓取数据。
- 实战与评测表现:内测 benchmark 表明 Kimi K3 (max) 在编码、agent 和对话能力上表现优异。早期 checkpoint 在开发后期就已能帮团队完成大部分 kernel 优化工作。
为什么重要
- K3 报告展示了极高水平的工程与算法创新,例如双缓存并行处理、快照式沙箱以及 FlashKDA 机制,为处理超大规模模型的数值稳定性和计算效率提供了新解法。开发者 @nrehiew 称其技术极其出色,认为报告在基础设施和模型架构方面保留了丰富的细节,具有很高的技术透明度。
2026-07-29 ~ 2026-07-29 · 18 条相关
一手来源
- Kimi K3 报告补充内测表,覆盖编码与 WebDev 评测 — nrehiew_ ·
- Kimi K3架构解析:采用分位数均衡与LatentMoE突破3T规模瓶颈 — nrehiew_ ·
- 开发者点评 Kimi K3:技术报告扎实,已能胜任内核优化 — nrehiew_ ·
- Kimi K3底层优化:KDA数值稳定性与分块并行计算改进 — nrehiew_ · 2026-07-29
- Kimi K3架构解析:引入块注意力残差与NoPE机制 — nrehiew_ · 2026-07-29
- 【源头】Kimi K3架构解析:采用分位数均衡与LatentMoE突破3T规模瓶颈 — nrehiew_ · 2026-07-29
- Kimi K3 从头训练 MoonViT-V2 来稳定多模态训练 — nrehiew_ · 2026-07-29
- Kimi K3 视觉编码器从头训练,称视觉评测更强 — nrehiew_ · 2026-07-29
- Kimi K3 称借 KDA 节省实现 2.5 倍 scaling 提升 — nrehiew_ · 2026-07-29
- Kimi K3 用网页搜索知识图谱合成 RL 任务 — nrehiew_ · 2026-07-29
- Kimi K3 用 QAT、RL 和 MOPD 训练多专家模型 — nrehiew_ · 2026-07-29
- Kimi K3 底层设施:FlashKDA 与分块并行计算优化 — nrehiew_ · 2026-07-29
- Kimi K3 并行策略:首次将 ViT 纳入流水线图 — nrehiew_ · 2026-07-29
- Kimi K3 加入 MoonEP 均衡与 ViT 流水线并行 — nrehiew_ · 2026-07-29
- Kimi K3 用 FlashKDA 让 chunk 并行可行 — nrehiew_ · 2026-07-29
- Kimi K3 报告披露双缓存推理与快照式沙箱 — nrehiew_ · 2026-07-29
- 【源头】Kimi K3 报告补充内测表,覆盖编码与 WebDev 评测 — nrehiew_ · 2026-07-29
- Kimi K3 进入 kernel 优化实战,并在内测中领先多款模型 — nrehiew_ · 2026-07-29
- 【源头】开发者点评 Kimi K3:技术报告扎实,已能胜任内核优化 — nrehiew_ · 2026-07-29