双 3090 部署 Qwen 实测:修改切分模式让处理速度飙升 4 倍
DjCanalex · reddit · 2026-08-07
一名开发者分享了使用双 RTX 3090 显卡通过 llama.cpp 部署 Qwen 27B 模型的深度性能调优经验。
问题定位
此前他一直使用 --split-mode tensor(张量切分)模式,虽然生成速度(tg)不错,但他发现提示词处理(pp)全被丢到了 CPU 上运行,导致处理速度卡在 400 t/s 左右。
性能飞跃
经过排查,他发现 llama-bench 能跑出 1600+ t/s 的理论成绩。在将切分模式切换回 --split-mode layer(层切分)后,GPU 接管了采样计算。虽然生成速度(tg)从 60-70 t/s 略降至 40-55 t/s,但提示词处理速度实现了 4 倍以上的暴涨,大幅优化了长上下文的整体推理效率。
「Infra」频道最新
- AWS 14年老兵万字长文:如何构建云级可扩展控制平面 — TheNickWalsh · 2026-08-07
- 马斯克:德州Terafab将成为地球上最大最值钱的建筑 — beffjezos · 2026-08-07
- VIGIL:终端实时硬件功耗监控仪表盘,支持CPU/GPU/RAM — tom_doerr · 2026-08-07
- ComfyUI 节点优化:MiniMax H3 生成耗时锐减 30% — nnorbbi · 2026-08-07
- DARPA 启动 ScAN 计划:研发模拟神经网络以突破算力瓶颈 — inductionheads · 2026-08-07
- MiniMax H3本地实测:开源视频生成迎来HD与原生音频 — MattVidPro · 2026-08-07