SGLang 0.5.15 推理提速

BanghuaZ · x · 2026-07-12

SGLang v0.5.15 发布,重点是面向生产推理的性能优化。 - 官方称在 **8x B300** 上,针对 **GLM-5.2 NVFP4** 的生产 serving 达到 **500+ tok/s/user**;在 **4x GB300** 上达到 **450 tok/s/user**(`bs=1`)。 - 这次周期主要围绕推理栈调优,并计划很快补上完整技术细节和运行命令。 - 新增支持的模型包括:**Hunyuan 3 (Hy3)**、**HRM-Text**、**NVIDIA LocateAnything-3B**、**Baidu Unlimited-OCR**、**JoyEcho**、**Qwen3.6**。 - 版本亮点还包括: - **Breakable CUDA Graph** 成为默认捕获路径 - 内建 **web search**,由 **Exa** 提供支持 - 为 **MLA** 模型加入 **decode context parallelism**,包括 **DeepSeek V3** - 为路由模型提供 **FlashInfer all-to-all**

所属事件:SGLang v0.5.15聚焦生产推理性能优化(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →