GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升

TheZachMueller · x · 2026-10-02

开发者 Zach Mueller 用 NVIDIA AI Perf 在 4 张 RTX 6000 Max-Q 上对 GLM-5.3-Flash NVFP4 量化版做速度测试,并发从 1 扫到 32。

关键发现:并发超过 8 后,单用户生成速度不再提升,而首 token 延迟(TTFT)持续上升;作者给出 Pareto 交互性曲线,说明本地部署该模型的实用并发上限。

所属事件:GLM-5.3-Flash NVFP4 部署实测:并发超 8 后无提升(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →