新论文将 LLM 推理 GPU collective 延迟压到光速下限 7% 以内
algo_diver · x · 2026-07-21
## 论文要点 这篇题为 **《Every μs Matters: Achieving Near Speed-of-Light Latency in GPU Collectives》** 的工作,针对长上下文 LLM 推理里一个常被忽视的瓶颈:**GPU collective 通信延迟**。 ## 主要结论 - 作者认为,随着长上下文解码普遍依赖大量小规模 collective 操作,推理瓶颈越来越从带宽转向**时延**。 - 论文提出三项关键优化方向: - 无需额外同步的执行路径 - 更高效地使用对称内存 - multicast 支持 - 基于 NCCL 的 device-side API,作者实现了自定义 collective kernel,并在 NCCL 微基准上验证。 - 结果显示:短消息和中等消息的延迟显著下降,开销降到**接近理论“光速下限” 7% 以内**。 ## 影响 - 这项工作直接改善了 LLM 推理中的 **inter-token latency** 和吞吐。 - 论文还展示了对 cuSOLVERMp 的收益,说明这类优化对更广泛的 HPC 工作负载也有价值。
「Infra」频道最新
- API 价格可以交给市场,前沿 AI 不该被财报决定 — McDonaghMatthew · 2026-07-21
- 三星成立机器人部门,加速推进人形机器人研发 — Polymarket · 2026-07-21
- x402 让 AI agent 用 USDC 在 Base 上直接付费调用工具 — SucceededMind · 2026-07-21
- CleanAir 用 3D U-Net 代理 CMAQ,一年模拟压到 10 秒 — bravo_abad · 2026-07-21
- OxDeAI 用签名授权把 agent 策略检查前移到执行前 — docybo · 2026-07-21
- LLM 单次成本翻三倍,原因不是流量而是重试和 prompt 膨胀 — Lance_Saul_85 · 2026-07-21