NVIDIA 与 ETH Zurich 通过删 barrier 降低 AllReduce 延迟
thoefler · x · 2026-07-22
NVIDIA 和 ETH Zurich 通过删掉全局 barrier 降低 AllReduce 延迟
这条帖子转发的是论文 The Barrier Tax,核心讨论长上下文解码中的通信瓶颈:当 KV cache 变大、batch size 变小后,collective 不再主要受带宽限制,而是开始受同步开销限制。
论文测到什么
- 在 4 张 GPU 的约 5 µs 小消息 AllReduce 场景里,同步开销约占 40% 的延迟。
- 在 GB200 上,一个全局内存 barrier 的代价超过 1 µs;很多 AllReduce kernel 需要两个 barrier。
他们怎么做
- LL:把 8 B 标志位塞进 16 B 原子写里。
- Sentinel:预填 -NaN 槽位,轮询直到变化。
- Double buffer:双缓冲,提前一轮执行。
- LL128 atomic:用 cache-line 级原子操作、原地归约。
结果
- 图中显示无 barrier kernel 约 2.37 µs,而 NCCL ring 约 11.0 µs。
- 在这个小消息场景里,速度约为 ring 的 4.6 倍。
- 论文估算:4 GPU 时可降低 7–13% 的 token 间延迟,8 GPU 时降低 9–11%。
- 每移除 1 µs 延迟,成本大约可降 0.9%。
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11