GLM-5.3-Flash NVFP4 实测:并发超 8 后单用户速度不再提升
TheZachMueller · x · 2026-10-02
开发者 Zach Mueller 用 NVIDIA AI Perf 在 4 张 RTX 6000 Max-Q 上对 GLM-5.3-Flash NVFP4 量化版做速度测试,并发从 1 扫到 32。
关键发现:并发超过 8 后,单用户生成速度不再提升,而首 token 延迟(TTFT)持续上升;作者给出 Pareto 交互性曲线,说明本地部署该模型的实用并发上限。
所属事件:GLM-5.3-Flash NVFP4 部署实测:并发超 8 后无提升(2 条相关)→
「Infra」频道最新
- MachGen 让 MiniMax H3 突破 15 秒上限,实现 30 秒连续视频 — MiniMax_AI · 2026-10-02
- 网友用两台 DGX Spark 加 5090 搭出全本地 LLM 电台 — jwhh91 · 2026-10-02
- 投资人吐槽:多数 neocloud 可靠性只有“九个五”,远不到五个九 — saranormous · 2026-10-02
- 传贷方要求 NVIDIA 芯片贷款需 25% 抵押,算力融资链现裂缝 — GaryMarcus · 2026-10-02
- 微软携 Snowflake 推商业指标标准化,助 AI 工具读懂企业数据 — xiaosun86 · 2026-10-02
- Stas Bekman 提出新指标 MSMF:用可持续 matmul FLOPS 替代峰值跑分 — StasBekman · 2026-10-02