SkewAdam分层优化器大幅降低MoE训练显存

一篇新预印本论文提出了专为MoE训练设计的分层优化器SkewAdam。该优化器打破参数一视同仁的处理方式,将MoE参数分为稠密主干等三类并分配不同精度与状态。通过这一策略,SkewAdam成功将优化器显存占用大幅降低97.4%,把60亿参数级别的模型优化器状态压缩至1.29GB,使其能够完全放入单张40GB显存的GPU中训练。

2026-07-22 ~ 2026-07-22 · 2 条相关

另有 1 条近重复转述:Nuemaan Malik