16GB 显存跑 Qwen3-27B agent:开 MTP 掉上下文还变笨?

Remarkable_Air_8383 · reddit · 2026-10-03

作者用 llama.cpp 在 16GB 显存本地跑 qwen3 27B(iq3s 量化)为 Hermes agent 服务,发现开启 MTP draft 后 prefill 变慢、模型表现似乎变差,且显存吃紧只能把上下文压到 96k,解码速度约 40-60 tps;关闭 MTP 则可恢复 128k 上下文,但解码降至约 35 tps,发帖征询取舍建议。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →