混插 3090 与 5070 Ti 跑本地大模型:性能与 VRAM 的取舍难题
mrgreatheart · reddit · 2026-09-06
Reddit 用户在规划本地推理硬件时遇到混合架构问题:已有一张 5070 Ti 和两张 5060 Ti(均为 16GB),Qwen3.8-27B-IQ4-XS-MTP 在 llama.cpp 中用张量并行跑出 60 tok/s 解码、1500 pp 的成绩。
原计划再加一张 5070 Ti 组成两对 32GB,但当地 NVIDIA 价格刚涨了 25%;一张 3090 Founders Edition 更便宜,还多 8GB VRAM 且显存带宽略高。顾虑在于:
- Ampere 混 Blackwell 在 llama.cpp 的 tensor parallelism 下据说有性能损失
- vLLM 对不匹配的显卡基本无法做 TP
他在纠结是否值得为 8GB 额外显存接受更差的性能,并询问是否改用 pipeline parallelism(按层切分)配合两张高带宽卡更快,或把 3090 设为主卡承接 K/V cache。
「Infra」频道最新
- Cathie Wood 称 Anthropic 每吉瓦付 500 亿美元,xAI 数据中心毛利可观 — Kyrannio · 2026-09-06
- 英伟达 35 亿美元投资联发科,其加入 NVLink Fusion 生态 — Beth_Kindig · 2026-09-06
- Pinokio 去重实战:复制一个 Maestro 就省下 140GB 磁盘 — cocktailpeanut · 2026-09-06
- AWS 沙特建首个 AI Zone:50MW 容量,Trainium 混 Nvidia GPU — Beth_Kindig · 2026-09-06
- GPT-3到GPT-6:OpenAI API价格五年降了数倍 — BLUECOW009 · 2026-09-06
- 数据中心「次声波害人」论遭打脸,作者点名 Benn Jordan 编造说法 — CharlesFLehman · 2026-09-06