RTX 4090 跑 Qwen 2.5 27B:无溢出配置分享
gavwhittaker · reddit · 2026-08-18
作者分享了在 RTX 4090 (24GB) 和 7800x3D (128GB RAM) 平台上运行 Qwen 2.5-27B-UD-Q4KXL.gguf 的配置方案。该配置下速度最快达 134 tps,最慢 44 tps,且完全不溢出到系统内存。
关键参数包括:
- -ngl 99: 全部层卸载到 GPU。
- --cache-type-k/v q80: KV Cache 使用 Q8 量化。
- --spec-type draft-mtp: 启用 speculate draft 模式加速。
- -fa on: 开启 Flash Attention。
- --reasoning-format deepseek: 模拟 DeepSeek 推理格式。
「Infra」频道最新
- Qwen 27B F16 版本运行实测与显存需求 — Blues520 · 2026-08-18
- M2 Ultra 运行 Qwen3.8-27B 速度基准测试实录 — planetearth80 · 2026-08-18
- GitNexus: 知识图谱让编程 Agent 成本减半 — ycombinator · 2026-08-18
- RDNA4显卡启用SageAttention完整指南:RX 9070 XT实测 — eloxH1Z1 · 2026-08-18
- Qwen3.8-27B 推理优化:RTX 3090 跑出 1150 tps — iamMess · 2026-08-18
- Fal 平台上线 Topaz Labs 全套模型,提供 16 个媒体增强端点 — OdinLovis · 2026-08-18