使用 Muon 优化器无需批次大小预热

nrehiew_ · x · 2026-08-27

分享的损失曲线显示,单独使用 Muon 优化器会导致极高的梯度范数和残差激活。研究发现,架构和优化器的改变使得最佳超参数向更大的批次大小和学习率偏移,且学习率衰减随模型增大而变慢。主要发现包括:使用 Muon 时不需要批次大小预热,因为小批次的惩罚过大;学习率调整拥有更宽的容错区间。

所属事件:Qwen 披露训练细节:全程 Muon 优化器与残差流设计(5 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →