DFlash2 推理加速实测:4080 16GB 跑 Qwen3.8-27B 速至 86.7 tok/s
Apprehensive_Bar6609 · reddit · 2026-08-26
一篇详细的技术指南展示了如何使用 DFlash2 投机解码技术在 RTX 4080 16GB 上加速 Qwen3.8-27B 的推理。
- 原理:DFlash2 通过一个小型 Drafter 模型并行预测多个 Token,再由大模型 Target 进行验证,实现无损加速。
- 搭建步骤:
- 从未合并的 PR #27342 分支编译 llama.cpp。
- 下载目标模型 (Qwen3.8-27B GGUF) 和对应的专用 Drafter 模型 (561MB)。
- 使用特定参数启动 llama-server,关键参数为 --spec-type draft-dflash 和 --model-draft。
- 性能数据:
- 4k 上下文:速度从 50.6 tok/s 提升至 86.7 tok/s (加速比 1.72x)。
- 120k 上下文:速度提升至 66.1 tok/s (加速比 1.31x)。
- 显存开销:仅增加 561MB VRAM。
- 注意事项:Drafter 模型必须与目标模型精确配对;nmax=3 时效果最佳;超过 122k 上下文时存在 PR Bug。
「Infra」频道最新
- Cerebras 放话:多代晶圆级路线图保住最快推理王座 — Sethwinterroth · 2026-08-26
- NVIDIA 推出 Groq 3 LPX 加速 AI Agent — badumtsssst · 2026-08-26
- 数据中心耗水量少于降雨量?专家质疑干旱地区适用性 — tdietterich · 2026-08-26
- 博主批评苹果软件栈落后,称 M7 难跑下一代 Agent — teortaxesTex · 2026-08-26
- Toloka Train 推出微调与压缩工具,降本达 37 倍 — MParakhin · 2026-08-26
- 微调谬误:模型饱和后成本比质量更重要 — rhythmrg · 2026-08-26