SGLang优化GLM-5.2推理:8xB300实现单用户500+ tok/s

BanghuaZ · x · 2026-07-15

SGLang团队发文分享了针对 GLM-5.2 NVFP4 模型的推理优化细节,在 8xB300 硬件上实现了单用户(bs=1)500+ tok/s 的生成速度。

所属事件:SGLang v0.5.15 调优 GLM-5.2,8×B300 跑出 500+ tok/s(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →