5090 显卡运行 Qwen 27B 本地模型:配置参数与优化分享
Rollingsound514 · reddit · 2026-08-27
用户分享了在 RTX 5090 (128GB RAM) 上运行 Qwen 2.5 27B GGUF 版本的具体 models.ini 配置。配置使用了 Q5KXL 量化、Flash Attention、262K 上下文窗口以及 KV Cache 的 Q80 设置。作者咨询是否应提高量化等级并降低上下文长度以提升编码精度,以及寻求其他优化建议。
「Infra」频道最新
- 320B 模型跑上 Mac:OrcaSAQ 量化法让 GLM-5.3 落地苹果芯 — alejandroll10 · 2026-08-27
- GLM 5.3 Flash 上线 RunInfra:254 tok/s、百万 token 上下文 — alejandroll10 · 2026-08-27
- Google Colossus 揭秘:以 HDD 价格提供 SSD 性能 — cis_female · 2026-08-27
- MiniMax H3 Max 后训模型:视频生成提速 50 倍 — Recoil42 · 2026-08-27
- 英伟达推 NVHBM 显存:带宽升 30%,功耗降 15% — zephyr_z9 · 2026-08-27
- Nikesh Shora 预测两年后 NeoCloud 估值将低于现价 — salgar · 2026-08-27