SGLang Optimizes GLM-5.2: 8xB300 Hits 500+ tok/s for Single User

BanghuaZ · x · 2026-07-15

The SGLang team shared details on their inference optimization for the GLM-5.2 NVFP4 model, achieving a generation speed of 500+ tok/s for a single user (bs=1) on 8xB300 hardware.

Related event: SGLang v0.5.15 tunes GLM-5.2 serving to 500+ tok/s on 8×B300(6 posts)→

Original post →

More from Infra

Infra channel →