双 3090 部署 Qwen 实测:修改切分模式让处理速度飙升 4 倍

DjCanalex · reddit · 2026-08-07

一名开发者分享了使用双 RTX 3090 显卡通过 llama.cpp 部署 Qwen 27B 模型的深度性能调优经验。

问题定位

此前他一直使用 --split-mode tensor(张量切分)模式,虽然生成速度(tg)不错,但他发现提示词处理(pp)全被丢到了 CPU 上运行,导致处理速度卡在 400 t/s 左右。

性能飞跃

经过排查,他发现 llama-bench 能跑出 1600+ t/s 的理论成绩。在将切分模式切换回 --split-mode layer(层切分)后,GPU 接管了采样计算。虽然生成速度(tg)从 60-70 t/s 略降至 40-55 t/s,但提示词处理速度实现了 4 倍以上的暴涨,大幅优化了长上下文的整体推理效率。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →