llama.cpp 在 32GB 显存上运行 Qwen3 27B 的完整配置
ggerganov · x · 2026-08-15
ggerganov 分享了在 32GB VRAM(如 RTX 5090)上使用 llama.cpp 运行 Qwen3 27B 模型的配置,包括使用 Q4KM 和 Q40 量化、MTP 推测解码、196K 上下文、Q80 KV 缓存以及 --reasoning-preserve --fit off --agent 选项。
所属事件:社区分享Qwen3.8-27B在32GB显存上的部署配置(4 条相关)→
「编程与Agent」频道最新
- 教程:用 Lovable MCP + Claude 10 倍速开发 App — MyCreativeOwls · 2026-08-15
- 盘点 AI Agent 通过 CI 的六种“作弊”手段与检测方案 — DearMoonbeam_007 · 2026-08-15
- 实测对比:Claude Code 长任务易中断,Codex 更稳定 — burkov · 2026-08-15
- Codex 推出编辑功能,支持 LaTeX/Markdown 文档微调 — aniketapanjwani · 2026-08-15
- Gemini CLI 修复子 Agent 终止原因覆盖 Bug — joneba-google · 2026-08-15
- AI 生成代码能否通过真实负载测试?Cosmos DB 实测揭秘 — adnan_hashmi · 2026-08-15