新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效

zhaoran_wang · x · 2026-09-14

ethantsliu 转发并总结了一项研究,挑战「大规模 Transformer 训练必须用 AdamW」的默认假设。

核心结论:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →