实战:在16GB显存上实现Qwen 3.8 27B 75t/s解码

Kernoriordan · reddit · 2026-08-31

作者分享了在 RTX 4080/5080 (16GB VRAM) 上运行 Qwen 3.8 27B 模型的调优经验,通过特定的混合量化版本和 llama.cpp 配置,实现了平均 75t/s、峰值 100t/s 的解码速度。

核心配置:

日志显示在长文本生成中速度非常稳定。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →