Red Hat AI发vLLM加速 checkpoint
vllm_project · x · 2026-07-16
Red Hat AI 给两个 NVIDIA 开源大模型发布了 DFlash speculator checkpoints:
- Nemotron Ultra 550B
- Nemotron Super 120B
它们基于 vLLM 的开源 Speculators 库训练,许可证为 Apache 2.0,并在 NVIDIA B200 上验证。官方给出了一条 vLLM 启用参数:--spec-model ... --spec-tokens 7 --spec-method dflash。
效果上,在数学和推理任务里平均约 7 个 draft token 接受 5 个,在代码任务(HumanEval)里平均约 7 个里接受 3.4 个。
所属事件:Red Hat AI为NVIDIA大模型发布DFlash推理加速检查点(2 条相关)→
「Infra」频道最新
- 腾讯参投的燧原科技上海上市首日暴涨 179%,募资 9.1 亿美元 — pstAsiatech · 2026-09-11
- Qwen3.8 Flash Next 本地跑出 49 tokens/s,双 3090 配置全公开 — whiteh4cker · 2026-09-11
- Qdrant 宣布三场免费社区活动:4 小时向量技术长直播压轴 — qdrant_engine · 2026-09-11
- 国内 B300 现货喊到 1600 万一台,3 倍溢价把国产卡推成推理最优解 — aigclink · 2026-09-11
- 实测:RunPod 自托管 Qwen 27B 生成仅 17 tok/s,长输出成本反输 OpenAI — yeah280 · 2026-09-11
- vLLM 详解 MiniMax M3 在 AMD MI355X 上的调优:单卡吞吐提升至 4.45 倍 — vllm_project · 2026-09-11