DeepSeek V4 Flash 调优实录:n_max=3 速度提升 39%
Responsible_Pain3278 · reddit · 2026-08-18
作者在 Strix Halo (Ubuntu, 128GB) 上对 DeepSeek-V4-Flash-0731 进行了为期一周的 Speculative Decoding 性能测试。
- 测试配置:模型量化为 UD-IQ3XXS,使用 Q6 attention,对比 DSpark Drafter 的 Q80 与自量化 Q2KS 版本。
- 核心结论:
- 最佳 nmax:nmax=3 达到峰值,平均速度 28.5 tok/s(1.39× 基线 20.48 tok/s)。
- 量化选择:Q2 与 Q8 表现差异极小(1-3%),建议占用更小的 Q2 版本 (6.45 GB)。
- 场景差异:代码/数学任务提升显著(最高 1.52×),散文/翻译提升有限(1.1-1.2×)。nmax 5-7 仅在高接受度任务(如重复文本)有效。
- 实战配置:作者给出最终运行命令(含 ngram-mod, max thinking effort 等),并提醒 64k 窗口测试数据不代表 128k 混合场景,实际预期速度为 22-28 tok/s。
「Infra」频道最新
- AI 开源依赖单一公司服务器?担忧生态中心化与断供风险 — Airyfy · 2026-08-18
- 火山引擎 OpenViking:智能体自进化上下文库 — volcengine · 2026-08-18
- FreeToken 宣称 MoE 推理速度大幅超越 llamacpp 与 Ollama — wavefnx · 2026-08-18
- Epoch AI 研究员:马斯克是唯一自建数据中心的前沿实验室 CEO — soumitrashukla9 · 2026-08-18
- AI 服务器需求致 MLCC 交付期分化,高端产品近 10 个月 — zephyr_z9 · 2026-08-18
- 英伟达拟担保高达 1050 亿美元贷款,被质疑通过融资买芯片制造虚假增长 — heypearlai · 2026-08-18