vLLM支持DFlash推理加速检查点
vllm_project · x · 2026-07-15
Red Hat AI 为 NVIDIA 的两个开放模型发布了 **DFlash speculative checkpoints**: - **Nemotron Ultra 550B** - **Nemotron Super 120B** 转发内容给出的效果是: - 在数学/推理任务上,平均可接受约 **5/7** 个 draft tokens - 在代码任务(HumanEval)上,平均可接受约 **3.4/7** 个 draft tokens 这些 checkpoint 使用开源 **Speculators** 库训练,许可证为 **Apache 2.0**,并在 **NVIDIA B200** 上验证。用户只需在 vLLM 中加一个 `--speculative-config` 参数即可启用。
所属事件:Red Hat AI为NVIDIA大模型发布DFlash推理加速检查点(2 条相关)→
「Infra」频道最新
- 多节点 vLLM 经过拓扑调优,单用户吞吐升至 47 tok/s — TheZachMueller · 2026-07-21
- AI 辅助 GPU 调试用上 NVIDIA Nsight Systems 套件 — MonaJalal_ · 2026-07-21
- Databricks 称向量检索加 AI Classify 比前沿模型便宜 100 倍 — hanlintang · 2026-07-21
- Gemini Batch API 延迟降 80%,Google 还加入部分批处理支持 — OfficialLoganK · 2026-07-21
- Kimi K3 低价是技术突破,还是中国成本优势 — Burning_magic · 2026-07-21
- 中国算力、SeedAudio 与飞书 ARR 同步更新的 AI 资讯汇总 — APPSO · 2026-07-21