Qwen3.8-27B 24GB 显存实测:开启 MTP 跑满 13 万上下文

sisyphus-cycle · reddit · 2026-08-17

作者分享了在 24GB 显存(4090)上运行 Qwen3.8-27B (Q4KM) 的 llama.cpp 配置与实测数据。通过调整 batch size 和 KV cache 量化,发现是在上下文长度与生成速度之间做权衡:关闭 MTP(Multi-Token Prediction)可获得约 19.4 万 tokens 的上下文,生成速度约 40 tps;开启 MTP 后上下文约 13.1 万 tokens,但生成速度提升至 65 tps(纯 Python 代码可达 80 tps)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →