TP=4 提速 5%:让 LLM 在 SM120 上启用 CustomAllReduce
TheZachMueller · x · 2026-10-03
Hugging Face 的 Zach Mueller 分享了一个推理优化小技巧:在 SM120(Blackwell 架构)GPU 上,告诉你的 LLM 启用 CustomAllReduce,就可以把张量并行从 TP=2 提升到 TP=4,从而白拿约 5% 的性能提升。
「Infra」频道最新
- The Daily Diff 新增 PDF 版,精选 GPU 推理优化与 KV 缓存复用好文 — arpit_bhayani · 2026-10-03
- ERRC 用压缩通信省带宽补偿量化误差,加速张量并行 LLM 推理 — PyTorch · 2026-10-03
- 开发者平台宣布降价一半,GitHub Action runner 降至 12 倍便宜 — aniketmaurya · 2026-10-03
- 手写 CuTe DSL Blackwell GEMM 达 1401 TFLOP/s,约 97% cuBLAS 水平 — retr0jirachi · 2026-10-03
- 图灵奖得主 Patterson:太阳能成本曲线近乎垂直下坠,将驱动奇点 — davidpattersonx · 2026-10-03
- 24GB 显存党实测:Strata 量化 MoE 让 Qwen Flash 取代 27B 稠密模型 — soyalemujica · 2026-10-03