Moonshot 称 Kimi K2.5 用 15.5T token 训练 1 万亿参数
CatAstro_Piyush · x · 2026-07-28
Moonshot 据称用 15.5T tokens 训练出了一个 1T 参数的 Kimi K2.5,而且整个过程“零不稳定”。
配图把机制讲得很直白:
- Muon 的高秩更新会把 QK 点积 放大
- 点积一旦失控,logits 会爆、loss 也会跟着炸
- 解决办法是对 QK 做 clip / 训练后重缩放,在保留 Muon 更新方向的同时,把训练稳定住
这条的重点不是单纯“又一个大模型”,而是 Moonshot 似乎把大规模训练的稳定性问题,压到了一个很工程化的优化技巧上。
「模型」频道最新
- Kimi 报告披露覆盖编程与 Agent 的内部评测体系 — stochasticchasm · 2026-07-28
- Claude 仍被称为最可控的模型集,尽管它很怪 — sloppenheimer · 2026-07-28
- 前端代码 Arena 榜单:Opus 5 Max 居首,Kimi K3 Max 紧随其后 — arena · 2026-07-28
- Kimi K3 Max 登顶 Arena 榜首,前端与 Agent 任务全面领先 — arena · 2026-07-28
- Kimi K3 上线 Hugging Face 推理 API,输出价格 15 美元/百万 tokens — mervenoyann · 2026-07-28
- OpenRouter 将 GPT-5.6 Terra 和 Luna 价格砍半 — OpenAIDevs · 2026-07-28