NVIDIA 研究称 SOAP 和 Muon 在大模型预训练中优于 AdamW
sudoraohacker · x · 2026-07-24
NVIDIA 这篇论文在讨论 LLM 预训练优化器如何继续扩展到更大规模。
- 论文认为,Muon 和 SOAP 这类更高阶优化器相比 AdamW 收敛更快,但一直受限于计算开销和数值稳定性。
- 作者针对 SOAP 在大 batch 场景下的不稳定,提出了包括 逐步 QR 正交化、改进预条件等算法修改,用来消除 loss spike 并稳定训练。
- 他们用统一设置比较了 SOAP、Muon、AdamW,并发现前两者在测试尺度上都持续优于 AdamW。
- 在多十亿参数、万亿 token 训练实验中,这些优化器在 最高 1 亿 token batch 的 next-token 预测下仍能保持稳定,而 AdamW 会退化。
- 论文还给出一个兼容 Megatron-LM 的 分层分布式优化器 实现,并开源了代码:NVIDIA-NeMo/Emerging-Optimizers。
所属事件:NVIDIA 论文指 SOAP 与 Muon 优化器优于 AdamW(3 条相关)→
「Infra」频道最新
- Apple 更新 Mini 与 Studio,OpenAI 携 Jony Ive 出硬件,双双施压 Nvidia — Stratechery · 2026-08-26
- 西班牙拟收紧数据中心监管:水电及安全标准升级 — Polymarket · 2026-08-26
- TorchMorph:PyTorch 生态的 CUDA 加速形态学库 — kornia_foss · 2026-08-26
- Shopify CEO 开源无数据库 Git 服务器:S3 即仓库 — Shruti_0810 · 2026-08-26
- Jalapeno 芯片表现强劲,揭示 Nvidia 架构推理劣势 — beffjezos · 2026-08-26
- 澳大利亚总理让步:AI 数据中心不再强制全用绿电供电 — nordicinst · 2026-08-26