GLM-5.3 量化版塞进 8 张 RTX Pro 6000,峰值解码 486 tok/s

TheZachMueller · x · 2026-09-30

kaine 分享了 GLM-5.3 的 NVFP4 量化部署实测:单节点 8 张 RTX Pro 6000 即可装下,nvidia 版量化实现 54 tok/s 解码、251k 上下文、峰值 476 tok/s;采用 DFlash2 的 incoai 版量化则达 93 tok/s 解码、123k 上下文、峰值 486 tok/s。Zach Mueller 补充讨论指出,NVLink 带宽瓶颈更多出现在训练而非推理场景。这展示了前沿大模型量化后可在消费级/工作站级硬件上跑出可用吞吐。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →