实测 DFlash 2 投机解码:真实编码提速 2.26 倍,叠加 n-gram 达 4.68 倍
FantasticNature7590 · reddit · 2026-08-23
作者花 3 天在 llama.cpp(PR #27342)上把 Inco AI 的 DFlash 2 投机解码与 MTP、n-gram 查找等全部投机方案在 Qwen 3.8 27B 上对比(单卡 RTX PRO 6000,并发 1):
- DFlash 2 单独:100 道真实 LiveCodeBench 题上 67.97→153.91 tok/s(2.26 倍),token 延迟 14.27→6.02ms,自然停止无强制;显存代价仅 +2.7GB。同宽度下优于 DFlash 1 的 2.00 倍,显存约为其一半。
- DFlash 2 + 单个 n-gram 表(k4v):18 轮编码会话的构建阶段达 4.68 倍(65.1→304.9 tok/s);但再加第二个表反而降到 3.77 倍——与 7 月 DFlash 1 时代双表最优的结论相反。
- 参数坑:推荐值 --spec-draft-n-max 7 已过峰值,取 5 在 8K 编码 prompt 上再多约 11%,且 7 是硬上限会被静默截断;--spec-draft-p-min 在 DFlash 2 路径中根本未被读取;合成基准 +52% 是 harness 退化假象,n-gram 在散文上反而 -30%。
- 可复现性:给出目标模型/drafter 量化与版本、冷却与防降频措施等完整配置,并诚实指出跨代对比并非严格 A/B。
「Infra」频道最新
- 实验计划:Mac 本地跑 Qwen 模型对抗云端安全扫描 — natesiggard · 2026-08-23
- 双 R9700 运行 vLLM:多实例导致吞吐减半 — Certain_Series6810 · 2026-08-23
- Qwen3.6 上 AMD 核显跑 449t/s,65k 上下文是真极限 — jstormes · 2026-08-23
- 12GB 显存最佳模型推荐:除了 GLM 4.7 Flash 还有什么? — OrangeThink5911 · 2026-08-23
- 预测市场:AI 泡沫今年破裂概率仅 12% — Polymarket · 2026-08-23
- 传英伟达对部分大客户提价 AI 服务器 15%+ — Polymarket · 2026-08-23