SGLang 0.5.15 推理提速
BanghuaZ · x · 2026-07-12
SGLang v0.5.15 发布,重点是面向生产推理的性能优化。 - 官方称在 **8x B300** 上,针对 **GLM-5.2 NVFP4** 的生产 serving 达到 **500+ tok/s/user**;在 **4x GB300** 上达到 **450 tok/s/user**(`bs=1`)。 - 这次周期主要围绕推理栈调优,并计划很快补上完整技术细节和运行命令。 - 新增支持的模型包括:**Hunyuan 3 (Hy3)**、**HRM-Text**、**NVIDIA LocateAnything-3B**、**Baidu Unlimited-OCR**、**JoyEcho**、**Qwen3.6**。 - 版本亮点还包括: - **Breakable CUDA Graph** 成为默认捕获路径 - 内建 **web search**,由 **Exa** 提供支持 - 为 **MLA** 模型加入 **decode context parallelism**,包括 **DeepSeek V3** - 为路由模型提供 **FlashInfer all-to-all**
所属事件:SGLang v0.5.15聚焦生产推理性能优化(2 条相关)→
「Infra」频道最新
- Emad Mostaque 认为 Kimi K3 推理成本未来数月可降 10 到 50 倍 — rohanpaul_ai · 2026-07-21
- TokenPrint 把 Qwen 推理做成 DevTools 式调试器 — Rich-Fruit-326 · 2026-07-21
- 路由故障让 Claude Code 智能体 3.5 小时烧掉 3020 万 token — RileyRalmuto · 2026-07-21
- 单集群可扩至50万卡,华为Atlas 950 SuperPoD算力架构曝光 — pstAsiatech · 2026-07-21
- 韩国七月前 20 天出口增逾五成,AI 芯片带动 — Polymarket · 2026-07-21
- Bittensor 阵营称去中心化训练可抵消数倍算力差距 — markjeffrey · 2026-07-21