16GB 显存跑 Qwen3-27B agent:开 MTP 掉上下文还变笨?
Remarkable_Air_8383 · reddit · 2026-10-03
作者用 llama.cpp 在 16GB 显存本地跑 qwen3 27B(iq3s 量化)为 Hermes agent 服务,发现开启 MTP draft 后 prefill 变慢、模型表现似乎变差,且显存吃紧只能把上下文压到 96k,解码速度约 40-60 tps;关闭 MTP 则可恢复 128k 上下文,但解码降至约 35 tps,发帖征询取舍建议。
「Infra」频道最新
- Cathie Wood:全球九成数据中心债务融资流向美国,实际税率约8% — rohanpaul_ai · 2026-10-03
- DeepSeek 开源 DeepGEMM-Ascend:华为昇腾 950 矩阵算子内核 — lmoroney · 2026-10-03
- 大内存+入门 GPU 跑 Qwen3-Next:Strata 混合推理达 45-50 tok/s — EmPips · 2026-10-03
- 马斯克称增长将远超预期,博主指能源是头号瓶颈 — RachelVT42 · 2026-10-03
- DwarfStar 4 发布:本地运行 DeepSeek V4.1、Qwen 与 GLM — yogthos · 2026-10-03
- 中端显卡用户集体观望:模型升级很快,但换卡的钱越来越不划算 — masiha97 · 2026-10-03