GPU 集合通信延迟优化至物理极限,LLM 推理性能显著提升

traviscline · x · 2026-08-25

这篇 arXiv 论文探讨了如何在扩展网络中将 GPU 集合通信延迟降至接近物理极限。研究发现,长文本解码密集型的大语言模型(LLM)推理受限于延迟,而非带宽。团队基于 NCCL 的设备端 API 开发了低延迟接口,实现了无屏障同步和对称内存的高效利用。微基准测试显示,中小型消息的延迟显著降低,开销仅比绝对硬件极限高 7%。集成到实际应用后,新内核改善了 LLM 推理的令牌间延迟和吞吐量,并加速了 cuSOLVERMp。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →