SGLang v0.5.20 ships: Intel XPU support, up to 52% faster decode
hsu_byron · x · 2026-09-23
SGLang v0.5.20 is out, welcoming Intel XPU to standard releases. Highlights:
- RL sampling masks make rollouts more reliable, with up to 52% faster decode
- Unified Radix Tree adds SWA branching-point caching: 20pt higher cache hit rate, 1/3 lower TTFT
- DSpark now supports PD + DCP for long-context serving
- SGLang Simulator brings scheduler & cache experiments to CPU
- ROCm model loading up to 12.5× faster
- SGLang-Diffusion cuts E2E latency up to 38%
New models include GLM-5.3-Flash, Qwen3.8-Flash-Next, K2 Horizon, Hy4-Preview, FastH3, and VDN-H3.
More from Infra
- Qualcomm's new chips stream 30B MoE weights from flash to RAM on demand — ryanshrout · 2026-09-23
- Qualcomm says Snapdragon's Hexagon NPU now runs 30B+ parameter MoE models on-device — samcharrington · 2026-09-23
- OpenAI Upgrades GPT-6 Prompt Caching With Higher Hit Rates and New Diagnostics — OpenAI News · 2026-09-23
- NCCL 2.31.2 ships GPU-driven CFT/RMA, 0-SM collectives, better multi-NIC for Blackwell-scale training — SkyLi0n · 2026-09-23
- vLLM ROCm lead maintainers only recently got persistent access to an MI355X cluster — AccBalanced · 2026-09-23
- South African Rights Groups Demand Moratorium on US Big Tech Data Centers — ChinasaTOkolo · 2026-09-23