GLM-5.3-Flash NVFP4 部署实测:并发超 8 后无提升

开发者 Zach Mueller 公开了在 4 张 RTX 6000 Max-Q 上部署 GLM-5.3-Flash NVFP4 量化版的完整 SGLang 配置,包括张量并行 4 及 MoE 后端等设置,并用 NVIDIA AI Perf 进行速度测试。结果显示并发超过 8 之后,单用户速度不再提升,为本地部署该模型提供了参考数据。

2026-10-02 ~ 2026-10-02 · 2 条相关