NVIDIA 论文指 SOAP 与 Muon 优化器优于 AdamW

NVIDIA 近期发布论文《SOAP, Muon, and Beyond》,探讨了大型语言模型预训练的优化器扩展问题。研究指出,随着预训练批处理规模的不断扩大,传统的 AdamW 优化器已遭遇瓶颈。实验表明,SOAP 和 Muon 等高阶优化器在应对大规模预训练时表现出更优异的性能,能够有效突破现有架构的扩展限制,推动模型训练效率进一步提升。

2026-07-24 ~ 2026-07-24 · 3 条相关