GLM 5.2 异步调参后单用户吞吐升至 47 tok/s
TheZachMueller · x · 2026-07-21
一套“邪门” GLM 5.2 部署,把单用户吞吐拉到 47 tok/s
这条帖子在讲一个针对 GLM 5.2 NVFP4 的极限推理部署优化过程:作者花了 10 小时 47 分钟、跑了 640 万 token 去调服务栈。
- 起点是常规的 6 GPU 多节点 vLLM,吞吐约 20 tok/s/user。
- 之后改成 TP2→TP4 非对称拓扑,尽量把跨节点流水线边界压到最小。
- 再通过 30/48 层切分 和异步 PP/NCCL 处理,既修掉 pipeline deadlock,又保持输出完全一致。
- 最终达到 T=1 时 47.1 tok/s/user、T=4 时 42.7 tok/s/user,四用户聚合吞吐 169 tok/s。
配图还列出了从 baseline 到最终峰值的逐步提升路径。
所属事件:极限拓扑调优让大模型推理吞吐达47 tok/s(2 条相关)→
「Infra」频道最新
- NVIDIA 公开 Vera CPU 细节,宣称机架可达 2.2 万核 — ryanshrout · 2026-07-22
- NVIDIA 称 Vera Rubin NVL72 比 Blackwell 每兆瓦多出 10 倍 token — nvidia · 2026-07-22
- AI 经济正在耗尽便宜算力,数据中心和电力成本飙升 — Scobleizer · 2026-07-22
- Ratel 让 agent 运行成本降到原来的 1/7 — tensorqt · 2026-07-22
- Weaviate 增加按查询剖析,定位慢搜索到底卡在哪一步 — CShorten30 · 2026-07-22
- Mistral 扩大与微软合作,并在欧洲增加 AI 算力 — MistralAI · 2026-07-22