llama.cpp 评测:DFlash2 推测快 20% 但上下文缩水 38%
Opening-Broccoli9190 · reddit · 2026-08-21
用户在 5090RTX 上使用 Qwen 3.8 27B (Q8) 模型,对比了 llama.cpp 中 DFlash2 与 MTP 两种推测解码策略的性能。
关键数据:
- 生成速度:DFlash2 平均比 MTP 快 20.2%。
- Prompt 解析:MTP 略快 1.3%(基本持平)。
- 上下文容量:DFlash2 最大 90,112 tokens,MTP 为 124,416 tokens。MTP 多出 38.1% 的可用上下文。
结论:
- 短任务追求速度可选 DFlash2。
- 长任务或大上下文工作(>100k)时,DFlash2 因压缩和边际效应导致性能优势下降,且损失了大量上下文空间,需谨慎使用。
附带了完整的 llama-server 启动参数配置。
所属事件:llama.cpp集成DFlash2,Qwen推理提速最高3倍(2 条相关)→
「Infra」频道最新
- 传英伟达拟数亿美元投资数据中心电力商 — Polymarket · 2026-08-21
- OpenAI 拟建 8GW 园区:3.5万岗后仅余2500,社区应争取什么? — Crescitaly · 2026-08-21
- OpenAI安全监控增加20%推理成本,改变Agent经济账 — Crescitaly · 2026-08-21
- 零数据保留下的安全检测:如何审计不可见内容? — Crescitaly · 2026-08-21
- Intel 发布 OpenVINO 2026.3,优化本地 AI 推理与内存 — emmanuelvivier · 2026-08-21
- 网友质疑 Ox Alpha 提供百万亿 token 的算力来源 — teortaxesTex · 2026-08-21