GPU 主动发网络请求:PyTorch GIN 让 all-to-all 提速 30%

PyTorch · x · 2026-09-30

AMD 的 Rishi Sinha 将在 PyTorch Conference North America 演讲,介绍 RCCL 团队与 TorchTitan(分布式训练框架)的整合工作:GPU-initiated networking (GIN) 让 GPU kernel 直接向远程 GPU 发起网络 put 操作,绕过通信开销这一分布式训练最大瓶颈之一。该方案使 all-to-all kernel 性能提升最高 30%,端到端性能提升 12%–15%。会议 10 月 20–21 日在圣何塞举行。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →