SGLang 0.5.15 推理提速
BanghuaZ · x · 2026-07-12
SGLang v0.5.15 发布,重点是面向生产推理的性能优化。
- 官方称在 8x B300 上,针对 GLM-5.2 NVFP4 的生产 serving 达到 500+ tok/s/user;在 4x GB300 上达到 450 tok/s/user(bs=1)。
- 这次周期主要围绕推理栈调优,并计划很快补上完整技术细节和运行命令。
- 新增支持的模型包括:Hunyuan 3 (Hy3)、HRM-Text、NVIDIA LocateAnything-3B、Baidu Unlimited-OCR、JoyEcho、Qwen3.6。
- 版本亮点还包括:
- Breakable CUDA Graph 成为默认捕获路径
- 内建 web search,由 Exa 提供支持
- 为 MLA 模型加入 decode context parallelism,包括 DeepSeek V3
- 为路由模型提供 FlashInfer all-to-all
所属事件:SGLang v0.5.15聚焦生产推理性能优化(2 条相关)→
「Infra」频道最新
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11
- 7900 XTX 24GB 能否跑 Qwen,Reddit 征集 ROCm 实测数据 — thenomadexplorerlife · 2026-09-11