Kimi K3 扩到 2.8T 参数并彻底弃用 RoPE
rasbt · x · 2026-07-28
Sebastian Raschka 复盘了昨天发布的 Kimi K3 架构图,重点指出它不是“全新路线”,而是 Kimi Linear 的大规模生产化版本,参数规模从 48B 扩到 2.8T。
他认为这次最关键的新组件是 LatentMoE,整体设计明显偏向 推理效率优化:例如把标准 MoE、普通注意力替换为更省算力的 LatentMoE / multi-head latent attention / Kimi Delta Attention。另外,K3 还引入了 attention residuals 来改善残差路径,代价是大约 训练成本 +4%、推理成本 +2%。
Raschka 还特别提到,K3 完全移除了 RoPE,统一使用 NoPE,这是他见过的首个 frontier 级别的全 NoPE 架构;同时新模型还具备 原生多模态能力。
所属事件:Kimi K3 架构复盘:七年演进不止于堆参数(6 条相关)→
「模型」频道最新
- Samaya 高配版在 FrontierFinance 夺冠且成本减半 — maithra_raghu · 2026-07-28
- 用户称取消 Anthropic 订阅后,ChatGPT 更适合大多数研究任务 — jd_pressman · 2026-07-28
- 用户初试 Kimi K3:速度偏慢,效果也一般 — evilsocket · 2026-07-28
- Moonshot 被曝用 Nvidia Blackwell 训练 Kimi K3 — RebeccaBellan · 2026-07-28
- CohereLabs 在 Hugging Face 上放出 North-Mini-Code-1.0-eagle — jacek2023 · 2026-07-28
- WeirdML v2 扩展到 19 项任务并加入成本对比 — scaling01 · 2026-07-28