llama.cpp 跑 Qwen3.6-35B MTP 投机解码,求 draft 接受率调优

Bulky-Priority6824 · reddit · 2026-09-07

一位用户在 Reddit 求助:用 llama.cpp 的 llama-server 本地部署 Qwen3.6-35B-A3B(MTP 版 Q8KXL 量化),开启 draft-MTP 投机解码(spec-draft-n-max 5),询问 draft 接受率是否已达到正常范围、还有什么可调的空间。

帖中给出完整启动命令,关键配置包括:

对想本地跑 MTP 投机解码的开发者是难得的完整参考配置。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →