NVIDIA 与 ETH Zurich 通过删 barrier 降低 AllReduce 延迟
thoefler · x · 2026-07-22
NVIDIA 和 ETH Zurich 通过删掉全局 barrier 降低 AllReduce 延迟
这条帖子转发的是论文 The Barrier Tax,核心讨论长上下文解码中的通信瓶颈:当 KV cache 变大、batch size 变小后,collective 不再主要受带宽限制,而是开始受同步开销限制。
论文测到什么
- 在 4 张 GPU 的约 5 µs 小消息 AllReduce 场景里,同步开销约占 40% 的延迟。
- 在 GB200 上,一个全局内存 barrier 的代价超过 1 µs;很多 AllReduce kernel 需要两个 barrier。
他们怎么做
- LL:把 8 B 标志位塞进 16 B 原子写里。
- Sentinel:预填 -NaN 槽位,轮询直到变化。
- Double buffer:双缓冲,提前一轮执行。
- LL128 atomic:用 cache-line 级原子操作、原地归约。
结果
- 图中显示无 barrier kernel 约 2.37 µs,而 NCCL ring 约 11.0 µs。
- 在这个小消息场景里,速度约为 ring 的 4.6 倍。
- 论文估算:4 GPU 时可降低 7–13% 的 token 间延迟,8 GPU 时降低 9–11%。
- 每移除 1 µs 延迟,成本大约可降 0.9%。
「Infra」频道最新
- Tokenizers 重构转向 SIMD,号称快 500 到 1000 倍 — vanstriendaniel · 2026-07-22
- Cloudflare 式基础设施让 agent-first 应用更容易搭建 — threepointone · 2026-07-22
- OpenFPM 的 CUDA 风格内核已可在 Apple GPU 上通过 Metal 运行 — Scobleizer · 2026-07-22
- SkewAdam 将 MoE 优化器显存降 97.4%,6.78B 可放进 40GB GPU — Kooky-Ad-4124 · 2026-07-22
- 三星据称拟以 200 亿欧元估值投资 Mistral 10 亿欧元 — rohanpaul_ai · 2026-07-22
- Grok Build 为开发者新增 token 统计与批处理诊断 — elonmusk · 2026-07-22