llama.cpp 高级用法:32GB 显存跑 Qwen3.8 27B 并启用投机解码
ggerganov · x · 2026-08-15
ggerganov 分享了在 32GB 显存(如 RTX 5090)上使用 llama.cpp 运行 Qwen3.8 27B 的详细命令,包括使用 GGUF 量化、投机解码(draft-mtp)、大上下文窗口(196k)和 agent 模式。
所属事件:社区分享Qwen3.8-27B在32GB显存上的部署配置(4 条相关)→
「编程与Agent」频道最新
- 教程:用 Lovable MCP + Claude 10 倍速开发 App — MyCreativeOwls · 2026-08-15
- 实测对比:Claude Code 长任务易中断,Codex 更稳定 — burkov · 2026-08-15
- Codex 推出编辑功能,支持 LaTeX/Markdown 文档微调 — aniketapanjwani · 2026-08-15
- Gemini CLI 修复子 Agent 终止原因覆盖 Bug — joneba-google · 2026-08-15
- AI 生成代码能否通过真实负载测试?Cosmos DB 实测揭秘 — adnan_hashmi · 2026-08-15
- Yukon加速开源研究:人类与智能体协作 — gajesh · 2026-08-15