Qwen3.8-27B 优化实录:速度飙升至 153 tok/s
TrifleHopeful5418 · reddit · 2026-08-21
作者通过 159 次实验,在 AMD Strix Halo (128GB) + RTX 3090 Ti 的异构配置下,将 Qwen3.8-27B 的生成长文本速度从 9.5 tok/s 提升至 153 tok/s(32K 代码上下文),并在 HumanEval 上跑赢双 3090 vLLM 集群。
核心优化手段:
- 更换 Chat Template: 切换至 Qwen-Sharp 模板,减少模型自述,缩短 44% 壁钟时间和 51% 输出 Token,效果显著优于数周的 GPU 调优。
- KV Cache 格式调整: 将 K 和 V 从 q80 降级至 q40,释放 2GB 显存,将所有全注意力层移至高速 GPU,预填和生成速度大幅提升。
- speculative decoding 配置: 使用 --spec-type draft-mtp,ngram-mod,在代码生成上获得 +72% 至 +140% 的加速,且不占用显存。
- llama.cpp 微调: 通过 --spec-draft-ubatch 释放 1GB 显存用于层放置。
- 视觉编码器卸载: 利用 MTMDBACKENDDEVICE=Vulkan1 将视觉编码器移至闲置 iGPU,避免 3090 Ti OOM。
避坑指南:
- 外部 Draft 模型因 PCIe 延迟反而更慢。
- Q6K 量化导致速度变慢且精度微降。
实测结果:
- HumanEval (164 题): 本地 159/164 (29.7 min) vs 远程 vLLM 157/164 (42.4 min)。
- 长文本检索: 本地全通过,耗时更短。
「Infra」频道最新
- 设置 CPU Limit 会让 K8s 应用变慢?这里有复现实验与证明 — JeremyCMorgan · 2026-08-21
- AI 应用如何上生产?实战演练 OpenTelemetry 与值班 Agent — Al_Grigor · 2026-08-21
- LLMRouter 2.0:统一路由开发与评测基准 — youjiaxuan · 2026-08-21
- 12GB 显卡本地跑 MiniMax H3:15 秒多镜头视频模板 — vortis23 · 2026-08-21
- llama.cpp 新增 LFM2/MoE 模型张量切分支持,推理性能提升显著 — pmttyji · 2026-08-21
- 花千元购入二手 3090:本地 AI 性能碾压 3060,Qwen 35B 生成快 20 倍 — Yanzihko · 2026-08-21