Qwen 披露训练细节:全程 Muon 优化器与残差流设计
@nrehiew 于 8 月 27 日发布系列帖子,系统披露 Qwen 的训练细节与消融实验结论,覆盖优化器、超参数、Ngram 模块和残差流结构四个方面。
已确认
- 优化器方面,全网络使用 Muon;Router 和 GR 投影使用 AdamW 以保持稳定,Ngram 表使用不带权重衰减的 Adam;实施了 per head 正交化;采用张量并行(TP)训练。
- 超参数实验显示,架构和优化器的改变使最佳超参数向更大的批次大小和学习率偏移;使用 Muon 时不需要批次大小预热,因为小批次即可获得良好梯度噪声;学习率容错率更高,在最优值 sqrt(2) 倍范围内均表现良好;学习率衰减随模型增大而变慢。稳定性测试显示,在高学习率下单独使用 Muon 会导致极高的梯度范数和残差激活。
- Ngram 模块借鉴 DeepSeek Engram,消融其放置在不同层的效果未发现明显胜者,最终置于第 2 层以便与第 1 层计算时从 CPU 预取。实验发现 Loss 并非完美信号:随着词汇量增加,下游 Loss 出现权衡(材料未给出最终取舍细节)。
- 残差流设计方面,拓宽残差流带来实质性收益,其中一个分支处理来自前层的输入,其他三个分支是局部的;文档对比了 HyperConnections 与简化变体,并介绍了自研的 GatedResidual 变体。
为什么重要
- Muon 在大规模生产级模型中全程使用并配合针对性稳定策略,为社区提供了优化器选型与调参的一手参考,尤其是无需批次大小预热、学习率容错更宽这两个可显著降低调参成本的结论。
- Ngram 模块的实验表明训练 Loss 与下游表现并非总是一致,提示仅凭 Loss 选型存在风险,对后续模型设计有方法论意义。
2026-08-27 ~ 2026-08-27 · 5 条相关
一手来源
- Qwen 训练细节:全网络使用 Muon 及 TP 均衡策略 — nrehiew_ ·
- Qwen 超参数实验:Muon 无需批处理预热且更稳定 — nrehiew_ ·
- Qwen 残差流设计:拓宽结构带来实质性收益 — nrehiew_ ·
- 【源头】Qwen 残差流设计:拓宽结构带来实质性收益 — nrehiew_ · 2026-08-27
- 【源头】Qwen 训练细节:全网络使用 Muon 及 TP 均衡策略 — nrehiew_ · 2026-08-27
- Ngram 模块实验:Loss 非完美信号,词汇量需权衡 — nrehiew_ · 2026-08-27
- 使用 Muon 优化器无需批次大小预热 — nrehiew_ · 2026-08-27
- 【源头】Qwen 超参数实验:Muon 无需批处理预热且更稳定 — nrehiew_ · 2026-08-27