本地跑 Qwen 模型怎么选投机解码:两套 llama.cpp 参数实测分享

cradlemann · reddit · 2026-09-21

作者在 AMD Ryzen AI 9 HX 470(96GB DDR5)上用 llama-server Vulkan 后端跑两个模型:Qwen3.8-Flash-Next-UD-Q4KXL 用 draft-mtp,ngram-map-k 投机解码;Qwen3.8-27B-UD-Q5KXL 用 draft-dflash,ngram-map-k,均配 spec-draft-n-max: 4、p-min 0.5。他分享参数同时发问:ngram 类解码到底有没有用?自己实测没看出明显差异,而 llama-bench 无法对投机模型做无偏测试,想听其他人的选择和理由。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →