Kimi K3 报告称缩放效率比 K2 提升 2.5 倍
ricklamers · x · 2026-07-28
这条帖子在转发 Kimi K3 的架构与缩放效率结果,结合配图能看到它和 Kimi K2 的关键差异。
- 表格显示,Kimi K3 从 K2 的 61 层 / 1.04T 总参数 / 32.6B 激活参数,提升到 93 层 / 2.78T 总参数 / 104.2B 激活参数。
- 训练上下文长度从 128K 扩到 1M,注意力机制也从 MLA 改成 Hybrid KDA–MLA。
- 论文图表宣称:在相同 FLOP 预算下,Kimi K3 的验证损失缩放效率比 Kimi K2 提升 2.5 倍。
所属事件:月之暗面发布 Kimi K3 技术报告,宣称训练效率提升 2.5 倍(9 条相关)→
「模型」频道最新
- Kimi K3 披露文本、代码、数学与视觉预训练配方 — stochasticchasm · 2026-07-28
- Kimi K3 部署估算:B200 需两节点,B300 可单节点 — HarveenChadha · 2026-07-28
- YC 访谈 Claude Code 创始人,谈 Opus 5、注入防护和系统提示词大删减 — ycombinator · 2026-07-28
- Kimi K3 只是权重可用,不是开源,且带非商业许可 — juntao · 2026-07-28
- The Verge 认为 Kimi K3 可能冲击美国闭源模型 — The Verge AI · 2026-07-28
- Kimi K3 已可在 Fireworks 上推理与训练 — omarsar0 · 2026-07-28