llama.cpp 评测:DFlash2 推测快 20% 但上下文缩水 38%

Opening-Broccoli9190 · reddit · 2026-08-21

用户在 5090RTX 上使用 Qwen 3.8 27B (Q8) 模型,对比了 llama.cpp 中 DFlash2 与 MTP 两种推测解码策略的性能。

关键数据:

结论:

附带了完整的 llama-server 启动参数配置。

所属事件:llama.cpp集成DFlash2,Qwen推理提速最高3倍(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →