Prime Intellect 用 NIXL 把万亿参数 RL 权重同步从 86 秒压到 4 秒
samsja19 · x · 2026-09-05
Prime Intellect 发布研究报告:在万亿参数 RL 训练中,trainer 到推理端的权重同步曾是卡在 60-90 秒的瓶颈。团队基于 NIXL 和 ModelExpress 重建了 GLM-5.2 的权重传输流程,将 refit 时间从 86 秒压缩到 4 秒,并移除了静态进程组约束,实现容错、弹性的推理。
要点:
- RL 训练每步优化后需将策略权重(多 TB 级)从 trainer 同步到 sampler;prime-rl 已把 1T 模型的步进时间压到 5 分钟内,权重传输成为新瓶颈。
- 常见 NCCL 方案依赖静态进程组,难以做容错与弹性;文件系统/delta 更新在跨数据中心场景有取舍。
- 新方案用 NIXL + ModelExpress 实现个位数秒级传输,大幅削减 GPU 空转时间。
所属事件:Prime Intellect 采用 NIXL 权重传输,800B 模型传输提速 9 倍至个位数秒(2 条相关)→
「Infra」频道最新
- AMD 携手 Cisco 与沙特 HUMAIN 部署 MI335X 集群,规划 250MW — Beth_Kindig · 2026-09-05
- Reef 发布推理原生基础设施:自改进 Agent 边学习边不间断服务 — pliang279 · 2026-09-05
- 从 1D 到 2D int8 量化 GPU kernel,博主分享底层性能跃升 — goyal__pramod · 2026-09-05
- Google DeepMind 推出免费在线书《How To Scale Your Model》讲透 TPU 上 LLM 扩展 — goyal__pramod · 2026-09-05
- 开发者优化 MoE 内核:BF16 提速 1.2 倍,MXFP8 提速 1.6 倍 — retr0jirachi · 2026-09-05
- 显卡能跑多少 token/s?一条显存带宽公式帮你估算上限 — Pyrolistical · 2026-09-05