双 RTX 5060 Ti 开启 P2P 仍然跑出 NaN
Environmental_Hand35 · reddit · 2026-07-25
一位用户在双 RTX 5060 Ti 工作站上测试 PCIe P2P(peer-to-peer)通信,使用的是打过补丁的 NVIDIA open kernel modules。nvidia-smi 显示两个方向都支持 peer access,但 CUDA 的 simpleP2P 正确性测试始终失败,返回 NaN,而且直接走 P2P 的路径还比 fallback 路径更慢。
帖中给出的配置与现象包括:
- MSI MPG Z890 Carbon WiFi 主板
- 2× RTX 5060 Ti 16GB
- Core Ultra 7 270K Plus,48GB DDR5-8800
- BIOS 里关闭了 VT-d/IOMMU,也尝试了不同内核启动参数
- cudaMemcpyPeer / cudaMemcpy 的带宽约 5.09 GB/s
- 但在验证阶段依然出现 NaN
作者希望其他 Blackwell 多 GPU 用户分享 simpleP2P 或 nvbandwidth 结果,用于对比和排障。
「Infra」频道最新
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- SF Compute 创始人:现在买算力是「绝对糟糕的体验」 — IgorCarron · 2026-09-11
- 开源 SmolVM:2026 年 Agent 不止用浏览器,而是拥有整台电脑 — aniketmaurya · 2026-09-11
- PyTorch Day Korea 2026 首届线下大会启动,9月13日截止征集演讲 — PyTorch · 2026-09-11
- 本地跑 LLM 选卡:4 张 CMP-170HX 涨价 vs Mac Studio M5 — rumboll · 2026-09-11
- llama.cpp 为 RDNA4 调优 Flash Attention,大上下文提升明显 — pmttyji · 2026-09-11