llama.cpp集成DFlash2,Qwen推理提速最高3倍

llama.cpp 新增的 DFlash2 功能(PR #27342)引发社区测试热潮。有用户在 RTX 6000 上对 Qwen 3.8 27B 模型对比四种解码方案,推理速度最高提升至3倍;也有用户在 RTX 5090 上用 Q8 量化版对比 DFlash2 与 MTP 两种推测解码策略,发现 DFlash2 推测速度快约20%,但代价是上下文长度缩水38%。

2026-08-20 ~ 2026-08-21 · 2 条相关

事件全程(共 14 集)→