Qwen3.8 实测:MTP 参数影响吞吐,Q4 精度胜过 Q8
New-Inspection7034 · reddit · 2026-08-17
作者在 RTX Pro 6000 Blackwell 上深度测试 Qwen3.8-27B (GGUF) 与 agent harness,发现性能调优与量化精度的反直觉结论:
1. MTP 参数不通用,需按版本重调
- 沿用 Qwen3.6 的 --spec-draft-n-max 12 导致吞吐暴跌。将其调至 5 后,速度从 63 tok/s 提升至 99 tok/s。
- 3.8 的草稿接受率在 n-max=12 时极不稳定(0.280.69),调至 5 后稳定在 0.82 以上。即使架构 tensor 布局一致,MTP 窗口参数也不可跨版本通用。
2. Q4 量化反超 Q8
- UD-Q4KXL 在吞吐上达到 126 tok/s,比 Q80 快 26%,且显存占用少 10GB。
- 在多项实际诊断任务中,Q4 质量与 Q8 持平甚至更好(曾发现 Q8 遗漏的系统提示词 Bug)。作者已将 Q4 设为日常驱动。
3. reasoningeffort > 量化精度
- 在修复真实 bug 时,xhigh 设定下 18 分钟无输出;medium 14 分钟给出正确修复;low 虽能用但较脆弱且耗时。
- 调节推理力度比单纯追求高精度量化更影响结果。
4. 模型升级暴露工具链 Bug
- 升级到 3.8 后,模型错误模式从“全面变弱”变为“在优秀工作中夹杂尖锐错误”,这种不一致性促使作者检查自己的 harness,最终发现了 6 个长期欺骗模型的 bug。
「Infra」频道最新
- Wici One 声称通过 NVMe 流式传输解决本地显存瓶颈 — Torodaddy · 2026-08-17
- 单卡 5090 跑出每秒 206 token,Qwen3.8-27B 性能实测 — StefanoGogioso · 2026-08-17
- antirez优化DwarfStar:Station上170 t/s生成,22k tokens/s预填充 — antirez · 2026-08-17
- 算力淘金热:CoreWeave 季度营收超早期巨头云厂商 — a16z · 2026-08-17
- 麦肯锡:自 22 年底美数据中心投资激增 200% — rvp · 2026-08-17
- RTX 3090 跑 Qwen3.8-27B 达 672 tps,极致量化优化 — iamMess · 2026-08-17