详解 CPU 优化器卸载:在 32 卡 GPU 上训练 131k 上下文模型

samsja19 · x · 2026-08-26

该技术将梯度、优化器状态和计算步骤完全卸载至 CPU,并在反向传播期间隐藏所有通信和计算开销。在长序列训练中(注意力计算占主导),可以实现完全的卸载重叠。实践中,虽然大规模训练通常使用 FSDP 分布式存储状态,但此功能允许在极少量 GPU(如 32 张)上调试大模型训练(如 GLM5 131k 上下文)。作者预测,在显存短缺的背景下,训练时的 CPU 卸载将成为常态。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →