Qwen 3.8 27B 量化实测:DFlash2 与 MTP 性能对决

Opening-Broccoli9190 · reddit · 2026-08-24

在 RTX 5090 上针对 Qwen 3.8 27B 进行的 llama.cpp 推理测试对比了 DFlash2 与 MTP 两种投机采样技术。结果显示,DFlash2 Q4 提供了最高速度(154 tps),Q2 则在上下文占用上优势明显;MTP 虽然能提供最大上下文,但综合速度与上下文的平衡性不如 DFlash2。测试建议避免使用 Q8 量化。

所属事件:Qwen 3.8 27B 量化实测:DFlash2 与 MTP 性能对决(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →