NVIDIA NeMo-DCR:1T 模型权重同步从 87.5 分钟压缩到 150 秒,提速最多 40 倍
dair_ai · x · 2026-10-09
NVIDIA 论文发现,RL 训练中每个更新步骤实际只有 0.6%–1.2% 的模型权重发生变化,但标准流程仍把完整 checkpoint 全量拷贝到 rollout 集群——一个 1T 模型跨两个 AWS region 的拷贝要 87.5 分钟。
NeMo-DCR 的做法:
- 只传输发生变化的权重值,rollout 集群拿到的 bit 与全量拷贝完全一致
- 把训练分片上的变更直接映射进 checkpoint 布局,编码为 XOR 掩码或覆盖写入
- 通过中继树(relay tree)边构建增量边流式传输,配合联合提交与重试处理传输中途失败
结果:1T 模型在 3% 变更率下同步只需 150 秒(原 87.5 分钟);从 30B 到 1T 模型,比全量传输快 12–40 倍。
所属事件:NVIDIA NeMo-DCR 将万亿参数模型权重同步提速至 40 倍(2 条相关)→
「Infra」频道最新
- 腾讯开源 STEPQuant:6-bit 递归状态省 68.7% 推理内存不失精度 — _akhaliq · 2026-10-09
- Bain 预测 2030 年全球 GPU/定制芯片出货 3860 万片,为 2023 年 10 倍 — Beth_Kindig · 2026-10-09
- 多团队共享 GPU 集群:AWS 发布 HyperPod 多租户参考架构 — AWS ML Blog · 2026-10-09
- Mistral 被指弃用核电转用七成煤电数据中心训练开源模型 — wavefnx · 2026-10-09
- 为什么每轮都把完整对话发给推理服务器?Reddit 热议服务端 KV 槽位 API 设想 — Vasili_Sk · 2026-10-09
- Zyphra 优化 MoE 专家路由通信,AMD MI300X 上提速至 2.63 倍 — QuentinAnthon15 · 2026-10-09