本地跑 Qwen 模型怎么选投机解码:两套 llama.cpp 参数实测分享
cradlemann · reddit · 2026-09-21
作者在 AMD Ryzen AI 9 HX 470(96GB DDR5)上用 llama-server Vulkan 后端跑两个模型:Qwen3.8-Flash-Next-UD-Q4KXL 用 draft-mtp,ngram-map-k 投机解码;Qwen3.8-27B-UD-Q5KXL 用 draft-dflash,ngram-map-k,均配 spec-draft-n-max: 4、p-min 0.5。他分享参数同时发问:ngram 类解码到底有没有用?自己实测没看出明显差异,而 llama-bench 无法对投机模型做无偏测试,想听其他人的选择和理由。
「Infra」频道最新
- 双卡 R9700 本地推理踩坑:从 LGA1700 升级 Threadripper 的 PCIe 通道账 — El_90 · 2026-09-21
- Komlós 猜想被宣布解决,数学家点出其对神经网络量化的隐含意义 — stevenstrogatz · 2026-09-21
- 英伟达点名 5 家用 AI 做清洁能源的公司:电网评估从 45 天缩到 2 分钟 — nordicinst · 2026-09-21
- Mozilla 实测:本地 30B 模型零 API 全程自动开出真实 PR — mozilla-ai · 2026-09-21
- NVIDIA 盘点 5 家 AI 清洁能源公司:电网审核从 45 天缩到 2 分钟 — NVIDIA Blog · 2026-09-21
- Cohere Labs 推出 Local AI 社区计划,聚焦本地推理与硬件调优 — Cohere_Labs · 2026-09-21