NVIDIA 与 ETH Zurich 通过删 barrier 降低 AllReduce 延迟
thoefler · x · 2026-07-22
NVIDIA 和 ETH Zurich 通过删掉全局 barrier 降低 AllReduce 延迟
这条帖子转发的是论文 The Barrier Tax,核心讨论长上下文解码中的通信瓶颈:当 KV cache 变大、batch size 变小后,collective 不再主要受带宽限制,而是开始受同步开销限制。
论文测到什么
- 在 4 张 GPU 的约 5 µs 小消息 AllReduce 场景里,同步开销约占 40% 的延迟。
- 在 GB200 上,一个全局内存 barrier 的代价超过 1 µs;很多 AllReduce kernel 需要两个 barrier。
他们怎么做
- LL:把 8 B 标志位塞进 16 B 原子写里。
- Sentinel:预填 -NaN 槽位,轮询直到变化。
- Double buffer:双缓冲,提前一轮执行。
- LL128 atomic:用 cache-line 级原子操作、原地归约。
结果
- 图中显示无 barrier kernel 约 2.37 µs,而 NCCL ring 约 11.0 µs。
- 在这个小消息场景里,速度约为 ring 的 4.6 倍。
- 论文估算:4 GPU 时可降低 7–13% 的 token 间延迟,8 GPU 时降低 9–11%。
- 每移除 1 µs 延迟,成本大约可降 0.9%。
「Infra」频道最新
- NVIDIA 称 Nemotron 3 Ultra 在 RTL 芯片设计任务上达 97.1% — NVIDIAAI · 2026-07-27
- 本地 Qwen 模型驱动机械臂测试 78 款手机续航 — gappyvalley · 2026-07-27
- MiniBot 2.40 新增 xAI、HF Studio 和 vLLM 支持 — Creative-Type9411 · 2026-07-27
- 苹果智能眼镜、英伟达SK合作与携程51.79亿罚单汇总 — APPSO · 2026-07-27
- DeepSeek 融资传闻、欧盟 AI 透明度规则与 OpenAI 安全事故 — 创业邦 · 2026-07-27
- QuixiCore 主张原生量化内核取代先反量化再执行 — QuixiAI · 2026-07-27