SGLang 在 B300 上跑出 500+ tok/s
mchiang0610 · x · 2026-07-15
这条转发围绕 SGLang + GLM-5.2 + NVIDIA B300 的服务优化展开,重点不是模型发布本身,而是推理/服务栈如何把前沿开源模型跑得更快、更稳。
引用内容给出的关键信息包括:
- 在真实多轮 agentic coding 工作负载上,SGLang 在 8xB300、bs=1 下实现了 500+ tok/s/user。
- 相比 day-0,两周内单用户交互性提升 18% 到 34%。
- 高并发场景下峰值吞吐提升 6% 到 11%。
- 新的 TopK-V2 kernel 在 80K ISL 时快 2.33x,到 1M ISL 可达 10.17x,且交互性在长上下文下基本保持平稳。
帖子还提到 GLM-5.2 采用了 IndexShare、更强的 MTP head 等架构设计,并强调“全开源栈”在 agentic coding 场景下更快、更稳定、更可靠。
所属事件:SGLang v0.5.15 调优 GLM-5.2,8×B300 跑出 500+ tok/s(6 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11