混插 3090 与 5070 Ti 跑本地大模型:性能与 VRAM 的取舍难题

mrgreatheart · reddit · 2026-09-06

Reddit 用户在规划本地推理硬件时遇到混合架构问题:已有一张 5070 Ti 和两张 5060 Ti(均为 16GB),Qwen3.8-27B-IQ4-XS-MTP 在 llama.cpp 中用张量并行跑出 60 tok/s 解码、1500 pp 的成绩。

原计划再加一张 5070 Ti 组成两对 32GB,但当地 NVIDIA 价格刚涨了 25%;一张 3090 Founders Edition 更便宜,还多 8GB VRAM 且显存带宽略高。顾虑在于:

他在纠结是否值得为 8GB 额外显存接受更差的性能,并询问是否改用 pipeline parallelism(按层切分)配合两张高带宽卡更快,或把 3090 设为主卡承接 K/V cache。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →