SOAP、Muon 与 KL-SOAP 笔记:AdamW 在大 batch 下撞墙
tokenbender · x · 2026-07-24
- 这组笔记解读了论文 《SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales》。
- 核心观点是:所谓 critical batch size 不只是模型和数据的属性,也和优化器有关;在超大 global batch 下,AdamW 会因为梯度噪声过低而失稳。
- 文中解释了同步预训练在大集群上的通信代价:小 batch 会被同步开销卡住,而大 batch 虽然更省经济成本,却会暴露优化器的上限。
- 笔记提到,在 72B 规模下,Muon 和 KL-SOAP 都优于 AdamW,其中 KL-SOAP 略胜一筹;Muon 的状态开销还低于 AdamW。
- 配图进一步说明:在 MoE 场景里,稀疏专家可能还能稳定工作,但共享/稠密参数会在超大 batch 下成为瓶颈。
所属事件:NVIDIA 论文指 SOAP 与 Muon 优化器优于 AdamW(3 条相关)→
「研究」频道最新
- 小红书 FireRedTTS3:统一语音生成与编辑模型 — jiqizhixin · 2026-08-26
- AI 协助论文是否算学术不端?学界激辩 — RichmanRonald · 2026-08-26
- Anima Anandkumar 创业项目登路透:训练 4D 物理模拟大模型 — iScienceLuvr · 2026-08-26
- Anima Anandkumar 创办新公司:训练万亿上下文的 4D 物理模拟模型 — xiaohu · 2026-08-26
- 不看你说了什么:新基准按环境操作痕迹给 Agent 判分 — alifcoder · 2026-08-26
- 研究称离散扩散将取代推测解码 — LucaAmb · 2026-08-26