SGLang将GLM-5.2推到500+ tok/s

ying11231 · x · 2026-07-15

这篇 deep dive 讲的是:如何用 SGLang 在 8×B300 上把 GLM-5.2 NVFP4 Agentic Workload 跑到 500+ tok/s/user(bs=1)。

文中给出的关键结果包括:

作者还说明了部分收益来自模型架构本身:GLM-5.2 在 DSA layers 里应用了 IndexShare,并引入更强的 MTP head,复用 IndexShare 和 KVShare;其余则来自 serving 优化。

所属事件:SGLang v0.5.15 调优 GLM-5.2,8×B300 跑出 500+ tok/s(6 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →