社区分享Qwen3.8-27B在32GB显存上的部署配置

社区分享了 Qwen3.8-27B 模型的多种部署配置。包括 ggerganov 提供的在 32GB 显存上使用 llama.cpp 运行的详细命令,以及 ggml-org 发布的 GGUF 量化模型,支持投机解码等优化。

2026-08-15 ~ 2026-08-15 · 4 条相关

另有 1 条近重复转述:ggerganov