消费级显卡开启 PCIe P2P,多卡本地部署吞吐量免费提升 25%
BidonPomoev · reddit · 2026-08-09
一位开发者在配备 4 张 RTX 5060Ti 的服务器上测试发现,为消费级 Nvidia 显卡开启 PCIe P2P 通信能显著提升 VLLM 的推理性能。
测试环境
- 硬件:AMD EPYC 服务器(约 150GB/s 内存带宽),4 张 5060Ti 16GB(PCIe 4.0 x8)
- 模型:Qwen3.6-27B-FP8(F16 KV 缓存,未使用 KV 量化)
- 并行策略:张量并行
性能收益
开启 P2P 后,在 32k 上下文深度下,首 Token 延迟(TTFT)大幅降低,Prefill(预填充)阶段的吞吐量实现了约 25% 的免费提升。
开启方法
- 硬件需支持并在 BIOS 中开启 ReBAR(Resizable BAR)。
- 安装社区修改版的 Nvidia 驱动程序。
「Infra」频道最新
- DeepSeek本地部署:投机解码导致极速掉速的排查 — Easy_Werewolf7903 · 2026-08-09
- 解决 AMD 显卡运行 MiniMax H3 输出黑屏问题 — Present-Guitar-3967 · 2026-08-09
- 美团发布 LongCat 2.0:全程基于国产 ASIC 训练推理 — bycloud · 2026-08-09
- RTX 5090跑MiniMax H3:视频生视频耗时暴涨至20分钟 — Chaztle · 2026-08-09
- MLX本地推理选哪款4bit量化?主流方案对比 — True_Tangerine_4706 · 2026-08-09
- 亚马逊德州数据中心配套电厂,或成美国最大气候污染源 — TechCrunch AI · 2026-08-09