SGLang 发布 0.5.15
ying11231 · x · 2026-07-15
转发内容引用了 SGLang v0.5.15 的发布,重点是围绕生产级推理服务做了一轮优化。
这次更新包括:
- 针对 GLM-5.2 NVFP4 的生产服务调优,在 8x B300 上达到 500+ tok/s/user,在 4x GB300 上达到 450 tok/s/user(bs=1)
- 计划在后续线程和博客里放出运行命令与完整技术细节
- 新增支持多种模型:Hunyuan 3、HRM-Text、NVIDIA LocateAnything-3B、Baidu Unlimited-OCR、JoyEcho、Qwen3.6
- 主要更新还包括:Breakable CUDA Graph 默认捕获路径、内置 web search(由 Exa 提供)、支持 MLA 模型的 decode context parallelism、FlashInfer all-to-all 等
所属事件:SGLang v0.5.15 调优 GLM-5.2,8×B300 跑出 500+ tok/s(6 条相关)→
「Infra」频道最新
- Engram 随机读取不适合 SSD,CPU 内存低延迟共享或成正解 — bookwormengr · 2026-09-11
- 劝退帖:推理工程是真金白银的硬活,八成尝鲜者已悄然放弃 — abhijithneil · 2026-09-11
- Hugging Face《Ultra Scale Playbook》:GPU 集群训练 LLM 的免费技术书 — mdancho84 · 2026-09-11
- 从聊天到 Agent,推理延迟正在成为生产级瓶颈 — Euphoric_Sea632 · 2026-09-11
- 推理服务关键指标盘点:流式速度 TPOT 与可用性如何影响体验 — abhijithneil · 2026-09-11
- PlanetScale 推出分片 Postgres,768 台服务器组成 1PB 单库 — dhruv2038 · 2026-09-11