GLM-5.3-Flash NVFP4 的 SGLang 部署配置全公开
TheZachMueller · x · 2026-10-02
Zach Mueller 公开其在 4 张 RTX 6000 Max-Q 上跑 GLM-5.3-Flash NVFP4 的完整 SGLang 配置:张量并行 4、MoE 后端 flashinfercutlass、量化 modeloptfp4、KV cache 用 fp8e4m3。
推测解码用 EAGLE(4 步、top-k 1、5 个草稿 token),并发上限 8、CUDA graphs 支持到 batch 8,并设置 NCCLP2PDISABLE=1。该配置与其并发扫描实测结果配套,可直接复现。
所属事件:GLM-5.3-Flash NVFP4 部署实测:并发超 8 后无提升(2 条相关)→
「Infra」频道最新
- MachGen 让 MiniMax H3 突破 15 秒上限,实现 30 秒连续视频 — MiniMax_AI · 2026-10-02
- 网友用两台 DGX Spark 加 5090 搭出全本地 LLM 电台 — jwhh91 · 2026-10-02
- 投资人吐槽:多数 neocloud 可靠性只有“九个五”,远不到五个九 — saranormous · 2026-10-02
- 传贷方要求 NVIDIA 芯片贷款需 25% 抵押,算力融资链现裂缝 — GaryMarcus · 2026-10-02
- 微软携 Snowflake 推商业指标标准化,助 AI 工具读懂企业数据 — xiaosun86 · 2026-10-02
- GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升 — TheZachMueller · 2026-10-02