SGLang v0.5.16 加入 DSpark 并首发支持 Inkling
BanghuaZ · x · 2026-07-25
SGLang 发布 v0.5.16,这次更新重点是推理加速和运行时优化。
- 新增 speculative decoding 算法 DSpark,官方称它在不同并发下都比 MTP 更有优势;在 DeepSeek-V4-Pro(TP8、B300、bs=1)上,接受长度约 5 时达到 383.7 tok/s。
- 对 Inkling 提供首发日支持,这是 Thinking Machines Lab 的首个 open-weights 模型,并已给出 Blackwell、H200、AMD MI350X/MI355X 的可验证 cookbook 方案。
- 同时新增对 LongCat 2.0 FP8、JetBrains Mellum v2、Pi0.5、LongLive 2.0 的支持。
- 其他优化包括:SWA/Mamba/DSA 共用 prefix cache、GLM-5.2 的跨 GPU cache 切分、GDN 更轻量的 speculative decoding,以及 Blackwell 上首个正确的 KDA MTP 路径。
「Infra」频道最新
- AI 芯片路线仍未定型,内存和光互连还有空间 — bookwormengr · 2026-07-25
- NVIDIA 将与韩国共建芯片、机器人和 AI 工厂 — nvidia · 2026-07-25
- 华为 950 NPU 传用四芯粒设计,SerDes 也独立拆分 — teortaxesTex · 2026-07-25
- ParseBench显示Opus 5文档理解接近4.8,但表格与价格不占优 — llama_index · 2026-07-25
- Databricks称Genie Code在401个真实任务上胜出且每题仅0.55美元 — DbrxMosaicAI · 2026-07-25
- Alphabet 未来支出承诺飙至 8110 亿美元,Stripe 传洽购 OpenRouter — 创业邦 · 2026-07-25