Kimi K3 扩到 2.8T 参数并彻底弃用 RoPE

rasbt · x · 2026-07-28

Sebastian Raschka 复盘了昨天发布的 Kimi K3 架构图,重点指出它不是“全新路线”,而是 Kimi Linear 的大规模生产化版本,参数规模从 48B 扩到 2.8T。

他认为这次最关键的新组件是 LatentMoE,整体设计明显偏向 推理效率优化:例如把标准 MoE、普通注意力替换为更省算力的 LatentMoE / multi-head latent attention / Kimi Delta Attention。另外,K3 还引入了 attention residuals 来改善残差路径,代价是大约 训练成本 +4%、推理成本 +2%。

Raschka 还特别提到,K3 完全移除了 RoPE,统一使用 NoPE,这是他见过的首个 frontier 级别的全 NoPE 架构;同时新模型还具备 原生多模态能力。

所属事件:Kimi K3 架构复盘:七年演进不止于堆参数(6 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →