SGLang v0.5.15 调优 GLM-5.2,8×B300 跑出 500+ tok/s

SGLang 发布 v0.5.15,把更新重点放在生产级推理服务的优化上,核心案例是用 8×B300 服务 GLM-5.2 NVFP4 的 agentic coding workload,在单用户(bs=1)场景跑到 500+ tok/s/user。这个版本之所以受关注,是因为讨论焦点已从“模型能不能跑”转向“开源前沿模型如何跑得更快、更稳”,并把单用户交互体验与高并发吞吐当作一对共同目标。

关键细节

多条转发转述的共识是:v0.5.15 属于一次服务端优化发布,针对 GLM-5.2 NVFP4 做了生产 serving 调优,8×B300 上达 500+ tok/s/user(bs=1),同时也展示了 4×B300 的结果,但当前材料未给出该配置的具体数字。这次分享面向的是真实多轮交互任务,而非单一跑分。

已披露的优化结果

@BanghuaZ 转述称,发布两周内单用户交互速度提升了 18%。

背景与意义

从这些转发可以看出,关注点已转向面向真实生产推理场景的系统优化能力,使 v0.5.15 的意义不只在版本号更新本身。

2026-07-15 ~ 2026-07-15 · 6 条相关

另有 3 条近重复转述:BanghuaZ · mchiang0610 · TheZachMueller