SGLang将GLM-5.2推到500+ tok/s
ying11231 · x · 2026-07-15
这篇 deep dive 讲的是:如何用 SGLang 在 8×B300 上把 GLM-5.2 NVFP4 Agentic Workload 跑到 500+ tok/s/user(bs=1)。
文中给出的关键结果包括:
- 在真实的多轮 agentic coding 工作负载上,单用户交互性相比 day-0 提升 18% 到 34%
- 在高并发下,峰值吞吐提升 6% 到 11%
- 新的 TopK-V2 kernel 在 80K ISL 下快 2.33x,到 1M ISL 可达 10.17x
- 交互性基本能一直维持到 1M tokens
作者还说明了部分收益来自模型架构本身:GLM-5.2 在 DSA layers 里应用了 IndexShare,并引入更强的 MTP head,复用 IndexShare 和 KVShare;其余则来自 serving 优化。
所属事件:SGLang v0.5.15 调优 GLM-5.2,8×B300 跑出 500+ tok/s(6 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11