Red Hat 发布 DSpark 新模型,vLLM 推理速度飙升 4 倍
vllm_project · x · 2026-08-08
Red Hat AI 在 Hugging Face 上发布了三款新的 DSpark 推测器(speculators),旨在通过并行起草(parallel drafting)技术加速大模型推理。这三款模型分别对应 Qwen3.6-35B-A3B、gemma-4-31B 和 GLM-5.2。
DSpark 能够在一次传递中起草整个 token 块,随后进行无损验证。以 GLM-5.2 模型为例,该技术实现了 4.0 倍的解码速度提升,单请求生成速度从 137 tokens/sec 跃升至 551 tokens/sec;同时峰值吞吐量提升了 1.57 倍(从 1,402 提升至 2,203 tokens/sec),在数学推理任务上的接受长度达到 5.47。这些模型可通过 @vllmproject 进行部署。
「Infra」频道最新
- 模型路由重塑AI经济账:Glean路由器降本50%并提速10倍 — VibeMarketer_ · 2026-08-08
- RTX 5090 跑 Qwen 3.6 27B 实测:262k 上下文速度达 40 t/s — Gargle-Loaf-Spunk · 2026-08-08
- Together AI 发布交互式图表,图解大模型量化与推理原理 — zainhas · 2026-08-08
- Nscale 传 IPO 前宣称获 510 亿美元合同收入,遭业内质疑 — nathanbenaich · 2026-08-08
- vLLM 联合英伟达优化,在 GB200 上实现 Qwen3.5 推理超 2.5 万 TPS — AccBalanced · 2026-08-08
- Baseten 推理工程大师课:如何将大模型权重转化为生产级应用 — yenkel · 2026-08-08