新论文将 LLM 推理 GPU collective 延迟压到光速下限 7% 以内

algo_diver · x · 2026-07-21

## 论文要点 这篇题为 **《Every μs Matters: Achieving Near Speed-of-Light Latency in GPU Collectives》** 的工作,针对长上下文 LLM 推理里一个常被忽视的瓶颈:**GPU collective 通信延迟**。 ## 主要结论 - 作者认为,随着长上下文解码普遍依赖大量小规模 collective 操作,推理瓶颈越来越从带宽转向**时延**。 - 论文提出三项关键优化方向: - 无需额外同步的执行路径 - 更高效地使用对称内存 - multicast 支持 - 基于 NCCL 的 device-side API,作者实现了自定义 collective kernel,并在 NCCL 微基准上验证。 - 结果显示:短消息和中等消息的延迟显著下降,开销降到**接近理论“光速下限” 7% 以内**。 ## 影响 - 这项工作直接改善了 LLM 推理中的 **inter-token latency** 和吞吐。 - 论文还展示了对 cuSOLVERMp 的收益,说明这类优化对更广泛的 HPC 工作负载也有价值。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →