实测 Qwen 3.8 配置:n-max 4 速度最快

GodComplecs · reddit · 2026-08-31

在 RTX 3090 上对 Qwen 3.8 UD Q4 KM 模型进行测试,发现 n-max 4 搭配 spec draft min p 0.7 在 harness 工作流中速度最快。配置支持 205k 上下文且开启 Flash Attention。实测显示该设置下测试生成速度达 70 tks,优于此前的 mtp2 配置。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →