NVIDIA 论文指 SOAP 与 Muon 优化器优于 AdamW
NVIDIA 近期发布论文《SOAP, Muon, and Beyond》,探讨了大型语言模型预训练的优化器扩展问题。研究指出,随着预训练批处理规模的不断扩大,传统的 AdamW 优化器已遭遇瓶颈。实验表明,SOAP 和 Muon 等高阶优化器在应对大规模预训练时表现出更优异的性能,能够有效突破现有架构的扩展限制,推动模型训练效率进一步提升。
2026-07-24 ~ 2026-07-24 · 3 条相关
- NVIDIA 论文探讨 SOAP、Muon 等预训练扩尺度方法 — A_K_Nain · 2026-07-24
- NVIDIA 研究称 SOAP 和 Muon 在大模型预训练中优于 AdamW — sudoraohacker · 2026-07-24
- SOAP、Muon 与 KL-SOAP 笔记:AdamW 在大 batch 下撞墙 — tokenbender · 2026-07-24