Kimi K3 架构解析:如何突破 MoE 规模极限
AndLukyane · x · 2026-08-04
本文深入解析了 Moonshot AI 的 Kimi K3 模型架构。文章指出,K3 并非单纯依赖后训练强化学习,而是同时扩展了预训练与后训练规模:总参数量达 2.8T(单 token 激活 104B),并引入了百万 token 级别的智能体轨迹。
模型架构围绕三种信息流进行扩展:
- 序列长度:交替使用 3 层高效的 Kimi Delta Attention(KDA)与 1 层全局 Gated MLA,兼顾长上下文成本与信息保留。
- 深度:引入 Attention Residuals,允许网络层选择性地检索早期模块的表示。
- 宽度:采用 Stable LatentMoE,将模型扩展至 896 个路由专家(每次激活 16 个)。
「模型」频道最新
- 数学家验证 GPT Pro:零计算错误,但证明表述极差 — josh_wills · 2026-08-04
- 蚂蚁员工长文:中国 AI 大厂的四个截然不同的战略赌注 — AcanthisittaOk1699 · 2026-08-04
- 传 OpenAI 将发 Astra 模型,主打多智能体协同 — thesaraharminta · 2026-08-04
- 实测 Qwen3.8-Max:开源模型在 Agent 任务已逼近闭源前沿 — dair_ai · 2026-08-04
- 推测 Kimi K3 达 2.8T 参数,或由更小的 Opus 蒸馏 — gabriberton · 2026-08-04
- 专家24小时复现OpenAI数学成果,Astra被指非质变 — Gary Marcus · 2026-08-04