四项调度技术压平 MoE 长上下文训练内存峰值,1M 上下文吞吐提升 10 倍

Shrey Pandit · hf · 2026-09-17

MoE 模型在长上下文或大 batch 下训练,只要任一组件峰值显存超限就会失败。论文指出常用并行方案对四个组件无约束:路由矩阵主导的 expert dispatch、tokens×词表的 vocab projection、深度×序列长度的 checkpoint 边界、以及参数量相关的优化器状态,且哪个先爆取决于模型与设备数。

作者提出四个只需改变计算/数据搬运顺序与粒度、保持 loss 和梯度精确的调度方案:

组合应用于 120B–667B 的 MoE 模型,可训练 1M 上下文,达调优 FSDP2 基线的 8–32 倍上下文和最高 10.4 倍吞吐。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →