llama.cpp 引入 DFlash 投机解码,本地推理大幅提速

近期,llama.cpp 项目合并了来自 z-lab 的 DFlash 投机解码技术(PR #22105),为本地大模型推理带来了显著的性能提升。此次技术整合由 NVIDIA 与 llama.cpp 作者 @ggerganov 合作完成,旨在进一步突破本地 AI 的运行速度瓶颈。

官方表态与实测数据

NVIDIA 官方账号表示,在引入 DFlash 支持后,DGX Spark 上的 llama.cpp 运行速度提升了约 2 倍。在具体性能表现上,开发者 @FantasticNature7590 在 RTX 6000 PRO 显卡上进行了实测:运行 Qwen 3.6 27B 模型(上下文长度为 36K)时,DFlash 的速度比此前表现最好的 MTP(多 Token 预测)方案快了 4.44 倍。

技术生态与影响

据 @ggerganov 介绍,DFlash 的加入进一步扩展了 llama.cpp 在投机解码方面的能力。结合现有的 MTP、Eagle3 以及各类基于 n-gram 的优化技巧,本地模型的推理性能又向前推进了一步。这标志着开源社区在降低本地大模型运行延迟、提升吞吐量方面取得了又一实质性进展。

2026-07-08 ~ 2026-07-09 · 5 条相关

一手来源