Kimi K3 架构深度解析:2.8T参数与注意力机制革新
Kimi K3(2.8T 参数、104B 激活参数的开权重 MoE 模型)发布后,技术社区对其架构进行了深度复盘,确认其并非单纯的参数堆砌,而是注意力机制与底层架构的重大演进。Sebastian Raschka 指出,K3 是 Kimi Linear 的大规模生产化版本,层数从 27 层扩至 93 层,并用潜 MoE 替代了标准 MoE。
已确认
- 核心架构参数:模型总参数 2.8T,激活参数 104B,共 93 层。其后训练配方分为 SFT cold start 等三个主要步骤。
- 注意力机制革新:K3 彻底去除了位置编码/位置嵌入,偏离了传统 Transformer 规范。它采用了混合的线性注意力与全注意力设计,并使用了自研的 Kimi Linear 变体。
- 长上下文优化:核心组件 Kimi Delta Attention (KDA) 极大优化了长上下文推理的显存成本。数据显示,在 128K tokens 下,其常量状态设计相比 All-MLA 显存降低约 73%;KDA 整体将 KV cache 压低 75%,并实现 6 倍提速。
为什么重要
多位分析者(如 peterjliu 和 bookwormengr)强调,理解 Kimi K3 不能仅看规模,而应将其置于从 GPT-2 以来的长期缩放与注意力原语演进史中。它证明了通过架构层面的创新(如去除位置编码、引入 KDA),可以在不盲目扩张算力的前提下,有效突破长上下文等推理瓶颈。
2026-07-27 ~ 2026-07-29 · 16 条相关
- 第 1 集:传闻称Gemini 3.5能力接近GPT-5.5水平(2026-07-05,3 条)
- 第 2 集:7月前沿AI模型发布时间表传闻汇总(2026-07-06,5 条)
- 第 3 集:多款重磅大模型版本近期密集发布(2026-07-08,3 条)
- 第 4 集:Gemini 3.5 Pro 多次传出延期与性能争议(2026-07-10,6 条)
- 第 5 集:AI基建牛市逻辑:开源模型或压缩前沿实验室利润(2026-07-13,3 条)
- 第 6 集:AI效率提升反将放大需求(2026-07-13,2 条)
- 第 7 集:AI安全焦点转移:从模型输出转向Agent执行风险(2026-07-13,9 条)
- 第 8 集:传 Gemini 3.5 Pro 近期发布(2026-07-14,3 条)
- 第 9 集:Kimi K3 预热升温,KIVINE 现身 Arena(2026-07-14,43 条)
- 第 10 集:Gemini 3.5 Pro 再延期传闻升温(2026-07-15,7 条)
- 第 11 集:前沿 AI 模型发布潮即将爆发(2026-07-15,2 条)
- 第 12 集:AI开源激辩:封闭能否换来安全(2026-07-15,10 条)
- 第 13 集:多家新模型发布传闻齐出,厂商均未官宣(2026-07-15,7 条)
- 第 14 集:Kimi K3 上线冲榜,开权重逼近前沿(2026-07-15,184 条)
- 第 15 集:Kimi K3 登顶前端代码榜引热议(2026-07-16,53 条)
- 第 16 集:大模型前沿优势窗口仅剩数月(2026-07-16,2 条)
- 第 17 集:Kimi K3 引爆中国前沿模型再评估(2026-07-16,94 条)
- 第 18 集:Kimi K3 性能比肩顶级模型引发 AI 圈热议(2026-07-16,3 条)
- 第 19 集:Kimi K3 实战编码能力引发争论(2026-07-16,6 条)
- 第 20 集:Kimi K3 开权重引爆开放模型争论(2026-07-17,15 条)
一手来源
- Kimi K3 扩到 2.8T 参数并彻底弃用 RoPE — rasbt ·
- Kimi K3 常量状态设计让长上下文显存降约 73% — bookwormengr ·
- Kimi Delta Attention 将 KV cache 压低 75% 并提速 6 倍 — johnseach ·
- 【源头】Kimi Delta Attention 将 KV cache 压低 75% 并提速 6 倍 — johnseach · 2026-07-27
- 七年开源模型架构演进,解释 Kimi K3 不只是变大 — philipkiely · 2026-07-27
- 一篇深度复盘把 Kimi K3 追溯到 GPT-2 与 8 篇论文 — Madisonkanna · 2026-07-27
- LLM 架构长演进梳理到 Kimi K3 — baseten · 2026-07-28
- Kimi K3 论文去掉位置嵌入,明显偏离 Transformer 传统 — peterjliu · 2026-07-28
- Kimi K3 据称沿用 block attention residuals,模型共 93 层 — burny_tech · 2026-07-28
- Kimi K3 被解读为远离 Transformer 的注意力原语演进 — AccBalanced · 2026-07-28
- Kimi K3 被用工业管道系统解释其架构设计 — doodlestein · 2026-07-28
- Baseten 工程师拆解 Kimi K3:七年迭代不是只靠堆参数 — khademinori · 2026-07-28
- 【源头】Kimi K3 扩到 2.8T 参数并彻底弃用 RoPE — rasbt · 2026-07-28
- Kimi K3 论文透露混合注意力与自研 Kimi Linear — peterjliu · 2026-07-28
- MoonshotAI 的 FlashKDA 提交暗示主线模型用了混合注意力 — peterjliu · 2026-07-29
- Kimi K3 报告披露 2.8T MoE 后训练配方 — cwolferesearch · 2026-07-29
- Kimi K3 发布:93 层架构,潜 MoE 替代标准 MoE — hugobowne · 2026-07-29
- 【源头】Kimi K3 常量状态设计让长上下文显存降约 73% — bookwormengr · 2026-07-29
另有 1 条近重复转述:bookwormengr