SGLang优化GLM-5.2推理:8xB300实现单用户500+ tok/s
BanghuaZ · x · 2026-07-15
SGLang团队发文分享了针对 GLM-5.2 NVFP4 模型的推理优化细节,在 8xB300 硬件上实现了单用户(bs=1)500+ tok/s 的生成速度。
- 性能表现:在发布两周内,将单用户交互速度提升了 18% 至 34%,并在高并发下将峰值吞吐量提升了 6% 至 11%。得益于全新的 TopK-V2 kernel,模型在 80K 到 1M token 的超长上下文中,交互延迟基本保持平稳。
- 优化策略:主要从两方面入手。一是削减系统开销,采用零气泡调度(zero-bubble scheduling)、移除同步操作和算子融合(kernel fusion);二是重写核心算子,包括 TopK-V2 和基于 CuTe DSL 的 GEMM。
- 模型架构优势:GLM-5.2 在其 DSA 层应用了 IndexShare 技术,并配备了复用 IndexShare 和 KVShare 的更强 MTP head,这些架构特性也助力了推理性能的提升。
所属事件:SGLang v0.5.15 调优 GLM-5.2,8×B300 跑出 500+ tok/s(6 条相关)→
「Infra」频道最新
- AI 消耗量分三波浪潮:2026 年 2 月 Agent 用量已超人类 — AccBalanced · 2026-09-11
- 英伟达已成主流 Robotaxi 栈核心:训练仿真车载计算全覆盖 — pdamodaran · 2026-09-11
- AI 工程师必懂的 12 种 KV Cache 压缩技术一文讲透 — blaizedsouza · 2026-09-11
- 影子算力市场走向台前,Meta 对外出售过剩 GPU 算力成标志性信号 — DavidLinthicum · 2026-09-11
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- RunningHub 开源 H3Lightning:MiniMax H3 视频生成提速约 12 倍 — 智东西 · 2026-09-11