8 卡 RTX 3060 跑 vLLM 划算吗:PCIe 带宽瓶颈之问
snakeat3rr · reddit · 2026-09-25
作者在 EPYC 平台(Huananzhi H12D-8D,2666MHz 内存)上搭建本地 AI 服务器,现有 4 张 RTX 3060 12GB,计划以 PCIe4 x16 跑 vLLM;主板每槽支持 bifurcation,可扩到 8 卡 x8。他提出的核心疑问:超过 4 卡后 PCIe 带宽瓶颈是否会大幅拖慢 token 生成速度,以及 3060 这种算力较低的卡是否比 3090 受惩罚更小。目前配置:llama.cpp 分层模式 3 张 3060 跑 Qwen 27B Q6 约 25 tps,预计 vLLM 4 卡可接近 50 tps,8 卡是否反而低于基线尚不确定。
「Infra」频道最新
- 从 KV Cache 到多智能体:一份循序渐进的 AI 系统设计开源指南 — blaizedsouza · 2026-09-25
- Yoav Goldberg 谈推理工程师真功夫:KV 缓存、通信、负载均衡才算入门 — yoavgo · 2026-09-25
- 数据中心噪音真凶是风扇低频:dBA 标准漏测了 73 Hz 嗡鸣 — CurieuxExplorer · 2026-09-25
- 10mm 超广角实拍跑 3DGS,作者吐槽 LichtFeld 默认暗角问题 — janusch_patas · 2026-09-25
- Brookings 估算美国 AI 基建至 2032 达 10.3 万亿美元,占 GDP 3.6% — emmanuelvivier · 2026-09-25
- Anthropic 与 Akamai 达成 120 亿美元 AI 算力协议 — CodeByPoonam · 2026-09-25