Qwen3.8 27B 16GB 显存跑满 10 万上下文 50 tok/s

qaf23 · reddit · 2026-08-29

作者分享了在 16GB 显存(RTX 4070 Ti SUPER)上运行 Qwen3.8-27B 模型并实现 100k 上下文、50 tok/s 生成速度的配置方案。核心技术点包括:使用 beellama.cpp 推理引擎;利用 kvarn5/kvarn4 非对称 KV Cache 量化以节省显存;保留尾部 1024 tokens 的高精度;启用 Speculative Decoding (draft-mtp)。该配置下 VRAM 占用约 15.93GB,实现了接近无损的质量提升。

所属事件:Qwen 3.8 27B 量化实测:16GB 显存可跑 20 万上下文(4 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →