NVIDIA CCCL 3.1 推出三档浮点确定性控制,GPU 间一致要慢 20-30%
blelbach · x · 2026-10-07
NVIDIA 技术博客介绍了 CUDA Core Compute Libraries(CCCL)3.1 中新增的浮点确定性控制能力,开发者 David Aronchick 转发并反驳「GPU 并行天然不可复现」的说法。
技术要点:
- 浮点加减法不满足结合律,并行归约因求和顺序不同而产生运行间差异,这是确定性难以保证的根源。
- CCCL 3.1 在 CUB 中引入单阶段 API,通过 execution environment 配置归约(reduction)的确定性,提供三档:
- notguaranteed:追求最高性能,结果可能变化
- runtorun(默认):同一 GPU 上多次运行结果一致
- gputogpu:跨 GPU 位级一致,使用可复现浮点累加器(Reproducible Floating-point Accumulator),默认 3 个指数 bin,误差界比标准 pairwise 求和更紧
- 代价:gputogpu 在 H200 上处理大规模问题时执行时间增加 20%-30%。
- 目前仅支持归约操作,后续将通过 GitHub issue 跟踪扩展到更多 CUDA 并行原语。
Aronchick 强调:部分实现中的非确定性是实现层面的缺口,而非并行计算的根本设计缺陷,现在可以通过该 API 显式控制。
所属事件:GPU 非确定性之辩:开发者逐条反驳,CCCL 3.1 出确定性控制(3 条相关)→
「Infra」频道最新
- RL 训练团队爆料:1T 全量权重同步低于 5 秒 — saurabh_shah2 · 2026-10-07
- NVIDIA 发布 UNREAL:一个模型统一语料检索与 128K 长上下文 — nvidia · 2026-10-07
- SlimWise 解耦 MoE 前后阶段专家剪枝,解码吞吐最高提升 1.81 倍 — Gunho Park · 2026-10-07
- Ora 扫描 10 万+网站:仅 5% 对 AI Agent 友好,平均分 41 — EdenEmarco177 · 2026-10-07
- 独立开发者吐槽 Together AI 限流:多 Agent 并行测试寸步难行 — Correct_Positive_108 · 2026-10-07
- 开源 Ramjet 亮相:本地多 GPU 推理编排,对标 NVIDIA Dynamo — DoggoProfessor959 · 2026-10-07