Kimi K3 称借 KDA 节省实现 2.5 倍 scaling 提升
nrehiew_ · x · 2026-07-29
这条继续补 Kimi K3 的训练信息,重点还是模型训练与 scaling。
- 作者观察到 RL FLOPs 曲线比较锯齿,推测每个 expert 的 RL 计算量可能没那么大,因此大量算力也许花在 MOPD 上。
- 预训练部分公开的信息很少,token 数量没有披露。
- 报告声称实现了 2.5× 的 scaling 改善,作者认为主要来自 KDA 的 FLOPs 节省。
- 超参搜索后,他们更偏好 cosine 而不是 WSD。
所属事件:Kimi K3 技术报告深度解读:架构与训练系统全面曝光(18 条相关)→
「模型」频道最新
- Grok 4.5 在 LaurenBench 以 56.9% 登顶,领先 Claude Sonnet 5 和 GLM 5.2 — elonmusk · 2026-07-29
- 一张爆图对比 12 类付费 AI 工具与免费替代品 — nikola_mr64990 · 2026-07-29
- Verdent 携手月之暗面,为 2.8T 参数 Kimi K3 优化编程工作流 — PrajwalTomar_ · 2026-07-29
- 120B 参数内最强本地模型求推荐:Qwen 系列仍是唯一解? — Possible_Grocery8079 · 2026-07-29
- OpenMed 发布开源医疗 AI 框架,结合 Kimi 本地处理临床数据 — MaziyarPanahi · 2026-07-29
- 教授实测 Flux 3:复杂提示词还原度极高 — emollick · 2026-07-29