vLLM支持DFlash推理加速检查点

vllm_project · x · 2026-07-15

Red Hat AI 为 NVIDIA 的两个开放模型发布了 **DFlash speculative checkpoints**: - **Nemotron Ultra 550B** - **Nemotron Super 120B** 转发内容给出的效果是: - 在数学/推理任务上,平均可接受约 **5/7** 个 draft tokens - 在代码任务(HumanEval)上,平均可接受约 **3.4/7** 个 draft tokens 这些 checkpoint 使用开源 **Speculators** 库训练,许可证为 **Apache 2.0**,并在 **NVIDIA B200** 上验证。用户只需在 vLLM 中加一个 `--speculative-config` 参数即可启用。

所属事件:Red Hat AI为NVIDIA大模型发布DFlash推理加速检查点(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →