Red Hat 发布 DSpark 新模型,vLLM 推理速度飙升 4 倍

vllm_project · x · 2026-08-08

Red Hat AI 在 Hugging Face 上发布了三款新的 DSpark 推测器(speculators),旨在通过并行起草(parallel drafting)技术加速大模型推理。这三款模型分别对应 Qwen3.6-35B-A3B、gemma-4-31B 和 GLM-5.2。

DSpark 能够在一次传递中起草整个 token 块,随后进行无损验证。以 GLM-5.2 模型为例,该技术实现了 4.0 倍的解码速度提升,单请求生成速度从 137 tokens/sec 跃升至 551 tokens/sec;同时峰值吞吐量提升了 1.57 倍(从 1,402 提升至 2,203 tokens/sec),在数学推理任务上的接受长度达到 5.47。这些模型可通过 @vllmproject 进行部署。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →