NCCL 2.31.2 发布:GPU 驱动 CFT 与 0-SM 集合通信,瞄准 Blackwell 级训练
SkyLi0n · x · 2026-09-23
NVIDIA 发布 NCCL 2.31.2,带来多项通信层升级:新增 GPU 驱动的 Compute Fabric Transport(CFT)host/device API,支持注册 window 内存并通过 CUDA 逻辑端点发起设备侧 Put/Get/Red/NVLS 操作(需 Blackwell GPU + CUDA 13.3+)。其他亮点:全部集合通信支持逐 collective 的配置与调优(ncclCollConfigt,可选算法、CTA/CGA 大小)、NVLS+PAT 改进、0-SM collectives、更强的多网卡/GIN 支持(AWS EFA 团队贡献 GDA 后端)、PACE fusion 等。作者认为对 MoE、FSDP、TP/EP 训练及 Blackwell 规模训练很有用。
所属事件:NVIDIA 发布 NCCL 2.31.2:GPU 驱动通信与 0-SM 集合通信升级(2 条相关)→
「Infra」频道最新
- AI 让内核漏洞利用平民化,容器不再构成安全边界 — OwariDa · 2026-09-23
- 推理需要芯片、内存与散热:AI 让智能的物质性显形 — demian_ai · 2026-09-23
- Go.AI 获 8500 万美元 A 轮融资,主攻受监管行业本地化 AI — PTrubey · 2026-09-23
- InstinctFlash 开源运行时:单张商用 GPU 实时跑 8 系列机器人通用模型 — chris_j_paxton · 2026-09-23
- M5 Ultra 96GB vs RTX 5090/6000 Pro:视频生成装机怎么选 — MaxwellHusk · 2026-09-23
- OpenAI 改进 GPT-6 提示缓存:命中率更高、新增诊断与显式断点 — OpenAI News · 2026-09-23