DDP 精确断点恢复失败复盘:原子加、autotune 与桶布局三重坑

ReinforcedKnowledge · reddit · 2026-08-28

作者在 open-Instruct 框架上用 4×A100 做 Qwen3.5-0.8B 的 DDP 训练,验证「checkpoint 后精确恢复」是否能与连续训练完全一致(连续跑 10 步 vs 第 5 步存档恢复再跑 5 步)。尽管 RNG、优化器、数据流等全部状态逐项核对一致,训练结果仍有差异。

逐层排查后发现三处元凶:

最终解法:恢复时先用一次确定性的合成全图 backward 初始化 reducer、显式重建桶、清空梯度并还原所有受保护状态,再喂真实数据。作者提醒这类精确一致只在少数需要严格可复现的场景有意义。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →