GLM 5.2 异步调参后单用户吞吐升至 47 tok/s

TheZachMueller · x · 2026-07-21

一套“邪门” GLM 5.2 部署,把单用户吞吐拉到 47 tok/s

这条帖子在讲一个针对 GLM 5.2 NVFP4 的极限推理部署优化过程:作者花了 10 小时 47 分钟、跑了 640 万 token 去调服务栈。

配图还列出了从 baseline 到最终峰值的逐步提升路径。

所属事件:极限拓扑调优让大模型推理吞吐达47 tok/s(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →