NVIDIA NeMo-DCR 将 1T 模型 RL 权重同步从 87.5 分钟压到 150 秒
IanAndrewsDC · x · 2026-10-09
NVIDIA 发布论文 NeMo-DCR,将万亿参数模型的 RL 训练权重同步(refit)从跨 AWS 区域传完整 checkpoint 的 87.5 分钟,压缩到 150 秒(3% 权重变化率)。
- 核心观察:每步 RL 训练只有 0.6–1.2% 的 BF16 权重变化(Qwen3 RL 在 1.5–2.0% 内),增量传输应成为大规模 RL 的工程默认。
- 技术路线:变化权重以对 rollout 节点上已有版本的 XOR 掩码编码(比全量覆写小 38–40%),再用 zstd level-1 压缩 1.7–2.2×;XOR 掩码对应仿射投影变化,非仿射变化用绝对覆写,保证逐位精确一致,传输中途失败可恢复。
- 瓶颈分析:传输占总延迟 77–94%,增量构造成本被流水线重叠隐藏,可忽略。
- 随着 RL 在前沿模型训练中占比越来越高,这类优化对训练吞吐影响重大。
「Infra」频道最新
- 8GB 显存笔记本跑通 MiniMax-H3 视频生成,作者求推荐文生图模型 — Zoaloo · 2026-10-09
- 推理算力交易所涌现:智能走向大宗商品化 — metehan777 · 2026-10-09
- Qwen3.8-flash 本地实测:Strix Halo 与 3090 双双跑出约 50 tok/s — drdanielbender · 2026-10-09
- 本地推理装机:Epyc 7443 + 四卡 72GB VRAM,总显存 328GB — mrgreatheart · 2026-10-09
- Synopsys 拟与中国 AI 实验室合作加速芯片设计,预测 FY27 营收 111.5 亿美元 — pstAsiatech · 2026-10-09
- TRL v1.15 默认启用融合 LM head,训练序列长度最高拉长 6.9 倍 — LysandreJik · 2026-10-09