GLM 5.2 异步调参后单用户吞吐升至 47 tok/s
TheZachMueller · x · 2026-07-21
一套“邪门” GLM 5.2 部署,把单用户吞吐拉到 47 tok/s
这条帖子在讲一个针对 GLM 5.2 NVFP4 的极限推理部署优化过程:作者花了 10 小时 47 分钟、跑了 640 万 token 去调服务栈。
- 起点是常规的 6 GPU 多节点 vLLM,吞吐约 20 tok/s/user。
- 之后改成 TP2→TP4 非对称拓扑,尽量把跨节点流水线边界压到最小。
- 再通过 30/48 层切分 和异步 PP/NCCL 处理,既修掉 pipeline deadlock,又保持输出完全一致。
- 最终达到 T=1 时 47.1 tok/s/user、T=4 时 42.7 tok/s/user,四用户聚合吞吐 169 tok/s。
配图还列出了从 baseline 到最终峰值的逐步提升路径。
所属事件:极限拓扑调优让大模型推理吞吐达47 tok/s(2 条相关)→
「Infra」频道最新
- AI 消耗量分三波浪潮:2026 年 2 月 Agent 用量已超人类 — AccBalanced · 2026-09-11
- 英伟达已成主流 Robotaxi 栈核心:训练仿真车载计算全覆盖 — pdamodaran · 2026-09-11
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11