SGLang v0.5.16 加入 DSpark 并首发支持 Inkling
BanghuaZ · x · 2026-07-25
SGLang 发布 v0.5.16,这次更新重点是推理加速和运行时优化。
- 新增 speculative decoding 算法 DSpark,官方称它在不同并发下都比 MTP 更有优势;在 DeepSeek-V4-Pro(TP8、B300、bs=1)上,接受长度约 5 时达到 383.7 tok/s。
- 对 Inkling 提供首发日支持,这是 Thinking Machines Lab 的首个 open-weights 模型,并已给出 Blackwell、H200、AMD MI350X/MI355X 的可验证 cookbook 方案。
- 同时新增对 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5、LongLive 2.0 的支持。
- 其他优化包括:SWA/Mamba/DSA 共用 prefix cache、GLM-5.2 的跨 GPU cache 切分、GDN 更轻量的 speculative decoding,以及 Blackwell 上首个正确的 KDA MTP 路径。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11