Qwen 3.8 27B 本地部署与 MTP 优化配置
gabrielesilinic · reddit · 2026-08-31
作者分享了在 AMD 7900XTX (24GB VRAM) 上运行 Qwen 3.8 27B-UD-IQ4XS 的详细配置与优化经验。
关键配置与参数:
- 使用 llama-server 部署,开启 Flash Attention。
- MTP (Speculative Draft): 配合 --spec-draft-n-max 3 和 --spec-draft-p-min 0.70,有效解决了长对话中 MTP 变慢的问题(低置信度时立即拒绝 draft)。
- KV Cache 量化: 开启 --cache-type-k q80 和 --cache-type-v q80,稳定性良好。
- 上下文: 140k 上下文下占用约 22.1GB 显存,速度达 22-30 t/s。
工具链:使用 llama-swap 管理模型启动,systemd 托管服务。作者提到 UD 版本量化比非 UD 版本更小且表现更好。
「Infra」频道最新
- Llama 3.1 本地部署导致后台常驻拖慢系统,卸载后恢复 — AiJohnAllen · 2026-08-31
- 解决 AI iOS 编码崩溃,SimSlim 工具可在单 Mac 运行更多模拟器 — bigblueboo · 2026-08-31
- iPhone 16 本地跑 8B 模型提取 52 页文档实测 — Better_Comment_7749 · 2026-08-31
- 苹果或因成本放弃 2027 年 iPhone 采用 HBM — power97992 · 2026-08-31
- 矩阵乘法能耗优化竞赛:挑战 AlphaTensor 算法 — yaroslavvb · 2026-08-31
- NVIDIA 推出 DGX Station 桌面级工作站 — SpendLucky1273 · 2026-08-31