优化被动 Oculink 设置意外实现 CUDA 调度器

TinFoilHat_69 · reddit · 2026-08-29

作者在优化 AMD 5950X 平台上的被动 Oculink x4 设置(用于 Qwen 模型推理)时,通过 NCCL to SHM hook 和 POSIX 共享内存锁,解决了 PCIe Gen 3 带宽瓶颈。该方法通过保持内存地址稳定和填充 CUDA 流队列,意外实现了一个类似“红绿灯”的任务调度器,使四张显卡能高效共享 PCIe 通道。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →