Cascade 拓扑反而更慢?多卡 P2P 通信的 PCIe 跳数陷阱

TheZachMueller · x · 2026-10-10

Zach Mueller 从线程中拎出一个多 GPU 通信的性能反直觉发现:理论上 Cascade 拓扑能让后半段计算完全绕开 CPU,但实际中由于每经过一个 PCIe switch 都增加跳数,跨卡流量在交换机之间东西向传递时开销叠加,反而可能比所有节点统一走 root(CPU) 的 common 拓扑更慢。Mike 补充解释:禁用 ACS 后 p2p 带宽才能放开,单 CPU 场景下 common 拓扑实测效果更好。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →