ERRC 用压缩通信省带宽补偿量化误差,加速张量并行 LLM 推理
PyTorch · x · 2026-10-03
PyTorch Foundation 大使 Abdulsalam Bande 将在 2026 年 PyTorch Conference North America(10 月 20-21 日,圣何塞)展示 ERRC(Entropy-Reinvested Residual Correction)海报。
- 目标:优化 LLM 推理期间 GPU 间数据交换,提升张量并行多卡推理效率。
- 方法:压缩 inter-GPU 通信,把节省的带宽用于缓解量化误差(熵再投资的残差校正)。
「Infra」频道最新
- The Daily Diff 新增 PDF 版,精选 GPU 推理优化与 KV 缓存复用好文 — arpit_bhayani · 2026-10-03
- 开发者平台宣布降价一半,GitHub Action runner 降至 12 倍便宜 — aniketmaurya · 2026-10-03
- TP=4 提速 5%:让 LLM 在 SM120 上启用 CustomAllReduce — TheZachMueller · 2026-10-03
- 手写 CuTe DSL Blackwell GEMM 达 1401 TFLOP/s,约 97% cuBLAS 水平 — retr0jirachi · 2026-10-03
- 图灵奖得主 Patterson:太阳能成本曲线近乎垂直下坠,将驱动奇点 — davidpattersonx · 2026-10-03
- 24GB 显存党实测:Strata 量化 MoE 让 Qwen Flash 取代 27B 稠密模型 — soyalemujica · 2026-10-03