实战:在16GB显存上实现Qwen 3.8 27B 75t/s解码
Kernoriordan · reddit · 2026-08-31
作者分享了在 RTX 4080/5080 (16GB VRAM) 上运行 Qwen 3.8 27B 模型的调优经验,通过特定的混合量化版本和 llama.cpp 配置,实现了平均 75t/s、峰值 100t/s 的解码速度。
核心配置:
- 模型:Qwen3.8-27B-i1-IQ4XS-GGUF-Smaller (专为 16GB 显存和 Multi-Token Prediction 设计)
- 关键参数:
- -ngl 99: 全部层 offload 到 GPU
- -c 85000: 上下文长度
- --spec-type draft-mtp: 启用 Multi-Token Prediction 投样
- --ctk q40 / --ctv q40: KV Cache 量化
日志显示在长文本生成中速度非常稳定。
「Infra」频道最新
- Qwen3.8 Flash 在双 DGX 上跑出 415 tok/s — NVIDIAAI · 2026-09-01
- 曝 OpenAI 自研芯片 Jalapeno:LLM 推理速度达 1500 tokens/s — firstadopter · 2026-09-01
- TensorSharp 跑 Qwen 3.8 Flash Next 性能实测 — fuzhongkai · 2026-09-01
- 腾讯混元 AngelSlim:Hy4 模型压缩至 214GB 并支持异构协同 — 腾讯混元 · 2026-09-01
- 三星为英伟达改推8层HBM4E,速率要求提高20% — 创业邦 · 2026-09-01
- 为何 Llama.cpp 中增大上下文反而提升了推理速度? — satnl · 2026-09-01