llama.cpp 集成 dflash2:Qwen 3.8 27B 推理提速至 3 倍

Top-Eye-8104 · reddit · 2026-08-20

用户在 RTX 6000 上测试了 llama.cpp 新增的 dflash2 功能(PR #27342),针对 Qwen 3.8 27B 模型进行了四种解码方案的对比:

中位数结果(4 个任务):

DFlash2 平均带来约 3 倍的性能提升,但在不同任务上表现不一,最低仅 1.5 倍增益,具体取决于任务特性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →