从 Adam 转向 Muon 中期训练?业界热议预训练优化器切换与 mxfp4 QAT
stochasticchasm · x · 2026-09-22
一条关于大模型训练细节的技术讨论:
- 发帖人注意到有预训练从中期训练(mid-training)开始从 Adam 切换到 Muon 优化器,并指出这似乎与 Kimi 的 Moonlight 论文结论相矛盾——该论文认为沿用同一优化器优于中途切换。
- 出现了一个此前不为人知的 Muown,疑似类似 NorMuon 的行归一化(row norm)改造版本。
- 另一观察:「没有 loss spike」并不代表性能没有退化,可能只是 eval 分数更低。
- 作者认为 mxfp4 QAT 已是中期训练的常规做法,且可能专门用于加速 RL rollout。
所属事件:分析称 xAI 与 Kimi 训练中途切换 Muon 优化器(3 条相关)→
「模型」频道最新
- 小米 MiMo-V2.6 开源双模型上线,1T 参数逼近前沿多模态推理 — teortaxesTex · 2026-09-22
- Jev 上线:不聊天只给赔率的「System One」决策模型,0.45 秒一次 — frappuccinoCoin · 2026-09-22
- 开发者吐槽 AI 编码最大痛点:模型还是太蠢、太慢、太贵 — remilouf · 2026-09-22
- 三值量化 Bonsai 2 27B 仅 5.9GB,保留 98.2% 性能并开源 — soumitrashukla9 · 2026-09-22
- 用户控诉 GPT-6 Astra Light 5 小时耗光一周额度,遭吐槽不如 Fable — PratikKadam_ · 2026-09-22
- Claude 主动后退拒绝推人:称要保持安全距离防止坠落 — repligate · 2026-09-22