vLLM支持DFlash推理加速检查点

vllm_project · x · 2026-07-15

Red Hat AI 为 NVIDIA 的两个开放模型发布了 DFlash speculative checkpoints:

转发内容给出的效果是:

这些 checkpoint 使用开源 Speculators 库训练,许可证为 Apache 2.0,并在 NVIDIA B200 上验证。用户只需在 vLLM 中加一个 --speculative-config 参数即可启用。

所属事件:Red Hat AI为NVIDIA大模型发布DFlash推理加速检查点(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →