新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效
zhaoran_wang · x · 2026-09-14
ethantsliu 转发并总结了一项研究,挑战「大规模 Transformer 训练必须用 AdamW」的默认假设。
核心结论:
- 在 RLVR(可验证奖励的强化学习)阶段,标准 SGD 效果与 AdamW 相当,且显存开销大幅降低——AdamW 需存储一阶与二阶梯度矩,内存负担极大。
- 论文指出 RL 与 SFT 是本质不同的训练机制:RL 中二阶矩的方差比 SFT 低约 22 倍,意味着大多数参数的有效步长几乎一致,自适应学习率意义不大;momentum 的影响也远小于预期。
- 由此推论:RL 阶段可以完全去掉 AdamW 的逐参数自适应性,换来更省内存、更稀疏的优化方案。
「Infra」频道最新
- Maia 200 每 1mm² 达约 12 TFLOP/s FP4,密度成第一设计目标 — thoefler · 2026-09-14
- 开发者晒 24/7 自托管 AI 栈:Open WebUI+Pidot+Tailscale 接 GLM/DeepSeek — andfanilo · 2026-09-14
- 网友揪出光子公司宣传图破绽:整张芯片图是镜像拼接的 — jwt0625 · 2026-09-14
- 工程师质疑 DeepSeek 带火的 inline PTX 热潮:写汇编不等于高性能 — mike64_t · 2026-09-14
- M3 Ultra 本地跑 Qwen3.8-Flash-Next:预填充 559 t/s,解码 31 t/s — rm-rf-rm · 2026-09-14
- RTX 5090 现货几近断货,价格或将进一步失控 — DustNearby2848 · 2026-09-14