GLM-5.3-Flash NVFP4 的 SGLang 部署配置全公开

TheZachMueller · x · 2026-10-02

Zach Mueller 公开其在 4 张 RTX 6000 Max-Q 上跑 GLM-5.3-Flash NVFP4 的完整 SGLang 配置:张量并行 4、MoE 后端 flashinfercutlass、量化 modeloptfp4、KV cache 用 fp8e4m3。

推测解码用 EAGLE(4 步、top-k 1、5 个草稿 token),并发上限 8、CUDA graphs 支持到 batch 8,并设置 NCCLP2PDISABLE=1。该配置与其并发扫描实测结果配套,可直接复现。

所属事件:GLM-5.3-Flash NVFP4 部署实测:并发超 8 后无提升(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →