llama.cpp 引入 DFlash 投机解码,本地推理大幅提速
近期,llama.cpp 项目合并了来自 z-lab 的 DFlash 投机解码技术(PR #22105),为本地大模型推理带来了显著的性能提升。此次技术整合由 NVIDIA 与 llama.cpp 作者 @ggerganov 合作完成,旨在进一步突破本地 AI 的运行速度瓶颈。
官方表态与实测数据
NVIDIA 官方账号表示,在引入 DFlash 支持后,DGX Spark 上的 llama.cpp 运行速度提升了约 2 倍。在具体性能表现上,开发者 @FantasticNature7590 在 RTX 6000 PRO 显卡上进行了实测:运行 Qwen 3.6 27B 模型(上下文长度为 36K)时,DFlash 的速度比此前表现最好的 MTP(多 Token 预测)方案快了 4.44 倍。
技术生态与影响
据 @ggerganov 介绍,DFlash 的加入进一步扩展了 llama.cpp 在投机解码方面的能力。结合现有的 MTP、Eagle3 以及各类基于 n-gram 的优化技巧,本地模型的推理性能又向前推进了一步。这标志着开源社区在降低本地大模型运行延迟、提升吞吐量方面取得了又一实质性进展。
2026-07-08 ~ 2026-07-09 · 5 条相关
一手来源
- DFlash合并入llama.cpp 本地推理快4.44倍 — FantasticNature7590 ·
- llama.cpp新增DFlash支持 — ggerganov ·
- 【源头】DFlash合并入llama.cpp 本地推理快4.44倍 — FantasticNature7590 · 2026-07-08
- 【源头】llama.cpp新增DFlash支持 — ggerganov · 2026-07-08
- llama.cpp 推测解码进展 — ggerganov · 2026-07-08
- Nvidia 称本地推理提速两倍 — Scobleizer · 2026-07-09
- llama.cpp 新增 DFlash 加速 — victormustar · 2026-07-09