SkewAdam 把 6.78B MoE 优化器状态压到 1.29GB
Nuemaan Malik · hf · 2026-07-22
这篇论文讨论的是 MoE 训练里最占内存的部分之一:优化器状态该放在哪里。
作者提出 SkewAdam,把 MoE 参数分成三类分别处理:
- 稠密主干:保留 float32 momentum 和分解式二阶矩
- 专家层:只保留分解式二阶矩
- 路由器:保留精确二阶矩
在一个 6.78B 参数的 MoE 语言模型上,这种设计把优化器状态从 50.6 GB 压到 1.29 GB,峰值训练显存从 81.4 GB 降到 31.3 GB,因此可在 40GB 显卡上训练。
在 82M tokens 的受控实验里,SkewAdam 的验证困惑度达到 108.4,优于 AdamW(126.8)、Muon(120.2)和 Lion(393.7)。论文同时指出:节省内存主要来自分层分配,而精度收益主要来自保留 momentum。
所属事件:SkewAdam分层优化器大幅降低MoE训练显存(2 条相关)→
「Infra」频道最新
- Unsloth 号称单张 4090 就能微调 7B 模型 — thisdudelikesAI · 2026-07-22
- 开放权重模型或推高硬件需求,因为它们解锁了新工作负载 — bookwormengr · 2026-07-22
- 中文模型已不稀奇,2026 代国产算力集群才是大新闻 — teortaxesTex · 2026-07-22
- Mark Cuban 预言不少 AI 数据中心可能改成球场 — 2C_ornot2C · 2026-07-22
- LLM 推理基准在真实流量前往往会误导团队 — Suspicious_Orchid770 · 2026-07-22
- Tokenizers 重构转向 SIMD,号称快 500 到 1000 倍 — vanstriendaniel · 2026-07-22