TP=4 提速 5%:让 LLM 在 SM120 上启用 CustomAllReduce

TheZachMueller · x · 2026-10-03

Hugging Face 的 Zach Mueller 分享了一个推理优化小技巧:在 SM120(Blackwell 架构)GPU 上,告诉你的 LLM 启用 CustomAllReduce,就可以把张量并行从 TP=2 提升到 TP=4,从而白拿约 5% 的性能提升。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →