Qwen3.8-27B 24GB 显存实测:开启 MTP 跑满 13 万上下文
sisyphus-cycle · reddit · 2026-08-17
作者分享了在 24GB 显存(4090)上运行 Qwen3.8-27B (Q4KM) 的 llama.cpp 配置与实测数据。通过调整 batch size 和 KV cache 量化,发现是在上下文长度与生成速度之间做权衡:关闭 MTP(Multi-Token Prediction)可获得约 19.4 万 tokens 的上下文,生成速度约 40 tps;开启 MTP 后上下文约 13.1 万 tokens,但生成速度提升至 65 tps(纯 Python 代码可达 80 tps)。
「Infra」频道最新
- 企业 AI 部署隐忧:数据外流呼唤主权 AI 架构 — Familiar-Display2989 · 2026-08-17
- 北大阶跃提出 TensorCast,统一张量管理层提速 228 倍 — 机器之心 · 2026-08-17
- dstack 结合机密计算实现云端代码隐私执行 — bgmshana · 2026-08-17
- AI 硬件工程新视角:能否理解并优化复杂工程模型? — rms80 · 2026-08-17
- 美人均用电峰值未恢复,算力扩张存物理上限 — jwt0625 · 2026-08-17
- 用户本地成功运行 Krea2 与 MiniMax Music — -becausereasons- · 2026-08-17