NVIDIA 认为 AdamW 碰到上限,SOAP 和 Muon 在万亿 token 训练中更强
omarsar0 · x · 2026-07-27
NVIDIA 发布了一篇关于大模型预训练优化器的新研究,核心判断是:AdamW 可能已经碰到规模上限。
论文里给出的结果是:在 next-token prediction 任务上,batch size 最高到 1 亿 token 时,SOAP 和 Muon 仍能保持训练稳定和较好的质量,而 AdamW 开始退化。作者还通过每步 QR 正交化和更好的预条件策略,修复了 SOAP 在大 batch 下的不稳定问题;Muon 的正交化效果也被用实证方式做了测量,而不是只做理论假设。
在数十亿参数、数万亿 token 的训练实验里,这两个高阶优化器都持续优于 AdamW。论文还给出一个兼容 Megatron-LM 的分层分布式优化器,实现了内存平衡和通信隐藏,同时不牺牲优化器数学本身的收益。
「Infra」频道最新
- AI 存储梗图称营销答案是 5.3,工程指标仍未定 — JoshuaJBouw · 2026-07-27
- 做本地 LLM 机器时该盯 RTX Ada 还是 5090 — egudegi · 2026-07-27
- 一篇文章拆解如何降低 Microsoft Fabric 容量成本 — adnan_hashmi · 2026-07-27
- Microsoft Fabric 的 sempy.fabric 包入门指南 — adnan_hashmi · 2026-07-27
- Voice AI 通话真实成本不止按分钟算 — decant338 · 2026-07-27
- 美光与 Meta 白皮书称 Spark 溢写 SSD 后可慢 38 倍 — dr_alphalyrae · 2026-07-27