8 卡 RTX 5070 Ti/5060 Ti 自组本地推理节点,vLLM 跑通 FP8 推理
Whahine · reddit · 2026-09-25
新西兰网友在 r/LocalLLaMA 展示了自建本地推理集群:两个自包含节点,一个装 4×RTX 5060 Ti、一个装 4×RTX 5070 Ti(均 16GB),通过 PLX 88096 switch 互联,动机是数据主权与隐私。
要点:
- 因当地「每人限购一张」的限制,逐月零散凑卡;发现 5060 Ti 与 5070 Ti 价差缩小后转向 5070 Ti
- 软件栈:Ubuntu 24.04、CUDA 13.2、vLLM 0.30,Docker 部署;节点内 NCCL P2P 已跑通,跨节点 P2P 仍待解决
- 完整给出了 vLLM 启动命令:Qwen3.8-27B-FP8 模型、FP8 量化、tensor-parallel 4、64K 上下文、gpu-memory-utilization 0.85
- 用 llama-benchy 做基准测试
- 踩坑包括不兼容的电源适配器/PCI riser、散热待优化、海外配件 2-4 周海运加 15% 关税
- 机箱可垂直安装节省桌面空间
对想复刻多消费级显卡本地推理的读者是难得的一手配置参考。
「Infra」频道最新
- 《现代微处理器 90 分钟指南》:系统/性能工程师的速成经典 — blaizedsouza · 2026-09-25
- GPU 成新资产类别:H100 一年回报 +76%,B300 租金指数涨 66% — KyeGomezB · 2026-09-25
- 开源 Jev 玩法:SGLang Radix Cache 助 Qwen3.6-35B-A3B 一秒跑完 64 个决策 — multiply_matrix · 2026-09-25
- Ramp 实测 Jev 替代 LLM 重排:尾延迟降 10 倍至 300ms、成本省 3 倍 — multiply_matrix · 2026-09-25
- 高通骁龙峰会主打'手机是 AI 中枢',欲造安卓版苹果式跨设备体验 — BenBajarin · 2026-09-25
- 5090本地跑Qwen3.8-Flash-Next:40tok/s且几乎不占内存 — nirurin · 2026-09-25