Red Hat AI发vLLM加速 checkpoint

vllm_project · x · 2026-07-16

Red Hat AI 给两个 NVIDIA 开源大模型发布了 DFlash speculator checkpoints:

它们基于 vLLM 的开源 Speculators 库训练,许可证为 Apache 2.0,并在 NVIDIA B200 上验证。官方给出了一条 vLLM 启用参数:--spec-model ... --spec-tokens 7 --spec-method dflash。

效果上,在数学和推理任务里平均约 7 个 draft token 接受 5 个,在代码任务(HumanEval)里平均约 7 个里接受 3.4 个。

所属事件:Red Hat AI为NVIDIA大模型发布DFlash推理加速检查点(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →