NVIDIA 认为 AdamW 碰到上限,SOAP 和 Muon 在万亿 token 训练中更强

omarsar0 · x · 2026-07-27

NVIDIA 发布了一篇关于大模型预训练优化器的新研究,核心判断是:AdamW 可能已经碰到规模上限。

论文里给出的结果是:在 next-token prediction 任务上,batch size 最高到 1 亿 token 时,SOAP 和 Muon 仍能保持训练稳定和较好的质量,而 AdamW 开始退化。作者还通过每步 QR 正交化和更好的预条件策略,修复了 SOAP 在大 batch 下的不稳定问题;Muon 的正交化效果也被用实证方式做了测量,而不是只做理论假设。

在数十亿参数、数万亿 token 的训练实验里,这两个高阶优化器都持续优于 AdamW。论文还给出一个兼容 Megatron-LM 的分层分布式优化器,实现了内存平衡和通信隐藏,同时不牺牲优化器数学本身的收益。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →