跨数据中心 RL 训练优化:500GB 模型权重同步降至 500MB
AI Engineer · youtube · 2026-08-11
Modal 的 Nan Jiang 分享了跨数据中心强化学习(RL)训练的工程优化方案。在 RL 训练中,前沿大模型的单次检查点体积达 500GB,跨区传输耗时极长,严重拖慢权重更新。
核心发现: 连续版本间实际发生变化的权重不到 1%。这并非因为梯度稀疏(99% 参数都有非零梯度),而是因为低精度服务的精度下限与微小的 Adam 更新步长之间存在差异(即 Adam 吸收效应)。
技术实现:
- 训练端只需发送约 500MB 的无损补丁,部署端即可重建 bitwise 一致的权重。
- FP8 等更低精度服务会使吸收效应更显著(如 GLM 4.7 Air 首步仅 0.15% 权重变化)。
- 以无损补丁替代全量检查点作为同步单元,使得 rollout 集群可彻底脱离训练集群,利用各地区的闲置 GPU 组成弹性资源池。Modal 的该实现被称为 Stitch。
「Infra」频道最新
- 曝微软计划“大幅”增产下一代自研 AI 芯片 — thoefler · 2026-08-11
- fal 签下 3 家生成式 AI 大厂,正扩充 H200 与 B300 算力 — gorkem · 2026-08-11
- Alphabet 拟发债融资 250 亿美元,重金押注 AI 算力基建 — Beth_Kindig · 2026-08-11
- 英伟达拟联手金融机构融资5000亿美元,加码AI芯片与数据中心 — Polymarket · 2026-08-11
- 修复 Intel Arc 显存异常:开发者推出 ComfyUI 稳定性补丁 — Valuable-Subject-274 · 2026-08-11
- 新研究提出 Oz-FP4:在 FP4 算力上模拟 FP64 高精度矩阵乘法 — teortaxesTex · 2026-08-11