四项调度技术压平 MoE 长上下文训练内存峰值,1M 上下文吞吐提升 10 倍
Shrey Pandit · hf · 2026-09-17
MoE 模型在长上下文或大 batch 下训练,只要任一组件峰值显存超限就会失败。论文指出常用并行方案对四个组件无约束:路由矩阵主导的 expert dispatch、tokens×词表的 vocab projection、深度×序列长度的 checkpoint 边界、以及参数量相关的优化器状态,且哪个先爆取决于模型与设备数。
作者提出四个只需改变计算/数据搬运顺序与粒度、保持 loss 和梯度精确的调度方案:
- PipelinedLLEP:最少负载专家并行加 dispatch token 上限,dispatch 峰值降最高 59.3% 且不损吞吐
- Ring-DTP:环形流转激活/权重分片,logit 块在线 log-sum-exp 折叠,vocab projection 峰值降 86.6%
- SCO:checkpoint 边界的长寿命张量卸载到 CPU
- OffloadStreamAdamW:把串行 CPU Adam 更新改成 bucket 流水线,卸载优化器步快 2.05 倍
组合应用于 120B–667B 的 MoE 模型,可训练 1M 上下文,达调优 FSDP2 基线的 8–32 倍上下文和最高 10.4 倍吞吐。
「Infra」频道最新
- OpenAI 将 Astra 迁至 Vera Rubin,72 小时再获 2 倍吞吐提升 — MickeySteamboat · 2026-09-17
- Baseten 推出 Hosted Tools:开源模型推理路径内直接联网搜索 — baseten · 2026-09-17
- 两张 5060 Ti 能不能训视频 LoRA?消费级多卡训练可行性讨论 — Inner_Employment_332 · 2026-09-17
- 15 个小模型各有一绝:7B 级也能打赢百倍大的模型 — bigaiguy · 2026-09-17
- 本地推理慢?推测解码用小模型起草、大模型批量验证 — HowDevelop · 2026-09-17
- 印度拟投约 300 亿美元建设本土半导体产业 — Polymarket · 2026-09-17