SkewAdam分层优化器大幅降低MoE训练显存
一篇新预印本论文提出了专为MoE训练设计的分层优化器SkewAdam。该优化器打破参数一视同仁的处理方式,将MoE参数分为稠密主干等三类并分配不同精度与状态。通过这一策略,SkewAdam成功将优化器显存占用大幅降低97.4%,把60亿参数级别的模型优化器状态压缩至1.29GB,使其能够完全放入单张40GB显存的GPU中训练。
2026-07-22 ~ 2026-07-22 · 2 条相关
- SkewAdam 将 MoE 优化器显存降 97.4%,6.78B 可放进 40GB GPU — Kooky-Ad-4124 · 2026-07-22
另有 1 条近重复转述:Nuemaan Malik