GPU 集合通信延迟优化至物理极限,LLM 推理性能显著提升
traviscline · x · 2026-08-25
这篇 arXiv 论文探讨了如何在扩展网络中将 GPU 集合通信延迟降至接近物理极限。研究发现,长文本解码密集型的大语言模型(LLM)推理受限于延迟,而非带宽。团队基于 NCCL 的设备端 API 开发了低延迟接口,实现了无屏障同步和对称内存的高效利用。微基准测试显示,中小型消息的延迟显著降低,开销仅比绝对硬件极限高 7%。集成到实际应用后,新内核改善了 LLM 推理的令牌间延迟和吞吐量,并加速了 cuSOLVERMp。
「Infra」频道最新
- FreeToken:带宽自适应 MoE 推理框架 — SteppenAxolotl · 2026-08-25
- 西弗吉尼亚拟用超大规模数据中心收入减税 — bradneuberg · 2026-08-25
- SGLang v0.5.18 发布:引擎提速 2.38 倍,支持 AMD NVFP4 — BanghuaZ · 2026-08-25
- Stoa Intelligence 推出 GPU 硬件实时定价追踪 — ycombinator · 2026-08-25
- Neon 深度解析:WAL+S3 构建适合 Agent 时代的数据库存储 — matei_zaharia · 2026-08-25
- Hot Chips 披露 Waymo 自动驾驶堆叠大量传感器方案 — firstadopter · 2026-08-25