Moonshot 称 Kimi K2.5 用 15.5T token 训练 1 万亿参数
CatAstro_Piyush · x · 2026-07-28
Moonshot 据称用 15.5T tokens 训练出了一个 1T 参数的 Kimi K2.5,而且整个过程“零不稳定”。
配图把机制讲得很直白:
- Muon 的高秩更新会把 QK 点积 放大
- 点积一旦失控,logits 会爆、loss 也会跟着炸
- 解决办法是对 QK 做 clip / 训练后重缩放,在保留 Muon 更新方向的同时,把训练稳定住
这条的重点不是单纯“又一个大模型”,而是 Moonshot 似乎把大规模训练的稳定性问题,压到了一个很工程化的优化技巧上。
「模型」频道最新
- 决策模型 Jev 接入 OM1,在 NVIDIA Isaac Sim 中驱动 Go2 机器人导航 — paigeinsf · 2026-09-23
- 网友辩称随机采样是智能必需:确定性模型或无法「思考」 — burny_tech · 2026-09-23
- 网友预测 2026 秋:Opus 5.5、GPT-6、Qwen4 同期登场 — IanAndrewsDC · 2026-09-23
- Cline 宣称 MiMo-v2.6-Pro 登顶开源权重模型榜 — burny_tech · 2026-09-23
- Anthropic 自嘲式官宣:Opus 5.5 远胜 Opus 5,网友戏称该向旧模型道歉 — repligate · 2026-09-23
- Opus 5.5 创作实测:「建议你把想要的都画出来」 — repligate · 2026-09-23