4 卡 GPU 服务器拓扑实战:一个 Gen5 Switch 就够,别多花冤枉钱
knowrohit07 · x · 2026-10-03
一位自建多卡 GPU 服务器的开发者在讨论 PCIe 拓扑设计:
- 对方原设想用 3 个 switch 做 root/leaf 结构以保证所有跨 switch 流量维持 53-56GB/s,并担忧跨芯片流量都要经过 CPU 导致严重瓶颈(引用研究称写速度可跌到 2.7GB/s)
- 作者指出:只有 4 张卡时,一个 Gen5 switch 带 4 个 x16 口即可覆盖,所有卡挂在同一颗芯片后面,跨卡流量根本不经过 CPU;只有把卡拆到多个 switch 上才会出现拥塞
- 每卡 96GB 的典型部署多为 TP2 或独立副本,跨卡流量本来就很少
- 还提醒 Supermicro H12 主板是 Gen4(带宽只有一半),H13 才是 Gen5,对方测出的 53-56GB/s 对应的应是 H13
- 建议:买 3 个 switch 之前先在单 switch 上跑 all-reduce 基准测试,如果 TP4 性能够用,额外的 switch 就是浪费钱
实用的一条自建推理服务器硬件选型经验帖。
「Infra」频道最新
- 爆料:xAI 11 月将上线约 42 万块英伟达 GPU 履行算力承诺 — mark_k · 2026-10-03
- 开源 MCP 服务器压测工具 mcpload,30 分钟 3780 会话零错误 — AKM121001 · 2026-10-03
- AI Conference Day 2:Agent推理成本与监控成全场焦点 — sanjaykalra · 2026-10-03
- Apple M5 Ultra 256GB 上下文实测:Qwen 量化模型 prefill 速度亮眼 — antirez · 2026-10-03
- Fractile 创始人谈 AI 芯片市场:如何结构性取胜与内存带宽瓶颈 — saranormous · 2026-10-03
- 软银 31 亿美元收购数据中心投资管理公司,扩建靠借债 — YvesMulkers · 2026-10-03