GLM-5.3-Flash NVFP4 部署实测:并发超 8 后无提升
开发者 Zach Mueller 公开了在 4 张 RTX 6000 Max-Q 上部署 GLM-5.3-Flash NVFP4 量化版的完整 SGLang 配置,包括张量并行 4 及 MoE 后端等设置,并用 NVIDIA AI Perf 进行速度测试。结果显示并发超过 8 之后,单用户速度不再提升,为本地部署该模型提供了参考数据。
2026-10-02 ~ 2026-10-02 · 2 条相关
- GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升 — TheZachMueller · 2026-10-02
- GLM-5.3-Flash NVFP4 的 SGLang 部署配置全公开 — TheZachMueller · 2026-10-02