NVIDIA NeMo-DCR:万亿参数 RL 权重同步提速 12-40 倍
nvidia · hf · 2026-10-07
NVIDIA 发布 NeMo-DCR(Delta-Compressed Refit),解决 agentic RL 训练-推理分离架构下权重同步(refit)的瓶颈:跨 AWS 区域传输完整 1T 检查点需 87.5 分钟,而 BF16 训练每步仅约 1% 的权重存储值发生变化。
设计要点:
- 只传增量但保证位级精确:接收端得到与稠密 refit 完全相同的参数与缓冲区比特。
- 布局:固定仿射映射将训练分片上的变更投影到检查点规范坐标,残差转换覆盖其余变更,由推理运行时原生加载器完成落位。
- 精确性:可压缩 XOR 掩码承载投影和加载保持存储位的仿射变更,其余用覆盖写;接收端原地应用,重试覆盖部分写入,联合提交将策略绑定到下一增量的基线。
- 效率:通过对象存储或中继树流式传输,无需跨集群集合通信。
即使变更率升到 3%-5%,30B-1T 模型的 refit 也比纯传输全量检查点快 12-40 倍;1T 模型中继树 refit 在 3% 变更率下从 87.5 分钟降至 150 秒,使跨集群万亿参数 agentic RL 的 refit 变得实用。
「Infra」频道最新
- 开源 Ramjet 亮相:本地多 GPU 推理编排,对标 NVIDIA Dynamo — DoggoProfessor959 · 2026-10-07
- Qwen3.8 Flash Next IQ3_S 量化版实测:基本无损且省内存 — lxfater · 2026-10-07
- 二手 PS5 Pro 卖到 1399 美元,AI 数据中心与玩家抢内存 — aakashgupta · 2026-10-07
- 马斯克放话:Terafab 芯片厂将完全自建自营,TSMC 至多转租一部分 — MickeySteamboat · 2026-10-07
- 用 3.8% 的 GPU 跑出 72% 的智能?Mistral 计算效率引热议 — cyb3rops · 2026-10-07
- 捷克央行行长亲自安装 8 块 GPU,AI 圈人士劝「多买点」 — misovalko · 2026-10-07