Cascade 拓扑反而更慢?多卡 P2P 通信的 PCIe 跳数陷阱
TheZachMueller · x · 2026-10-10
Zach Mueller 从线程中拎出一个多 GPU 通信的性能反直觉发现:理论上 Cascade 拓扑能让后半段计算完全绕开 CPU,但实际中由于每经过一个 PCIe switch 都增加跳数,跨卡流量在交换机之间东西向传递时开销叠加,反而可能比所有节点统一走 root(CPU) 的 common 拓扑更慢。Mike 补充解释:禁用 ACS 后 p2p 带宽才能放开,单 CPU 场景下 common 拓扑实测效果更好。
「Infra」频道最新
- 256GB DDR5 涨到 7200 美元,工程师把它当保值资产抢购 — CtrlAltDwayne · 2026-10-10
- Lemire 2026 重测 WebSocket:Bun 曾被高估, Anthropic 买下 Bun、Cloudflare 买下 Deno — lemire · 2026-10-10
- Cornell/IBM 新论文:共享 KV 缓存让循环模型省 76-79% 内存还更准 — yoavartzi · 2026-10-10
- 3090 单卡跑出 140 tok/s:自写 megakernel 比 llama.cpp 快 1.9 倍 — Adorable_Weakness_39 · 2026-10-10
- 香港实测:5090 整机近 9 万港币,5090 停产传闻可信度高 — karminski3 · 2026-10-10
- Orbio 融资 120 万美元,要让 AI Agent 自己 provisioning 算力 — econoar · 2026-10-10