llama.cpp 在 32GB 显存上运行 Qwen3 27B 的完整配置

ggerganov · x · 2026-08-15

ggerganov 分享了在 32GB VRAM(如 RTX 5090)上使用 llama.cpp 运行 Qwen3 27B 模型的配置,包括使用 Q4KM 和 Q40 量化、MTP 推测解码、196K 上下文、Q80 KV 缓存以及 --reasoning-preserve --fit off --agent 选项。

所属事件:社区分享Qwen3.8-27B在32GB显存上的部署配置(4 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →