PyTorch 新文档揭 Grace 架构 .cpu() 隐性瓶颈:复用 pinned 缓冲区
StasBekman · x · 2026-10-07
NVIDIA 的 Krishna Kalyan 正在为 PyTorch 提交文档 PR,讲清 NVLink-C2C 系统(Grace Hopper、Grace Blackwell)上 CUDA 到 CPU 传输的性能细节,合并前公开征询意见。
- 在 C2C 系统上 CPU↔GPU 拷贝自动走 C2C,瓶颈不在链路而在 CPU 侧:tensor.cpu() 每次分配新的 pageable 内存,首拷贝受页分配和缺页限制,而非带宽。
- 每步都调用 .cpu() 的 activation offloading 会反复付出这一代价。
- 文档给出的修复:一次性分配 pinned CPU 缓冲区并复用;同时说明同步规则、NUMA 放置,以及 pinned 内存在 OS 内存压缩下仍可能缺页的坑。
「Infra」频道最新
- 从 SSD 流式加载专家:DeepSeek V4.1 在 Mac 上跑到近 40 tps — HankYeomans · 2026-10-08
- Cloudflare 的机器支付豪赌:7500 万笔小额交易瞄准 $2000B 市场 — LexSokolin · 2026-10-08
- GPU 租赁全代际涨价:Nebius H100 提价 17%、B300 提价 21% — Beth_Kindig · 2026-10-08
- TypeSafeAI 上线四天在 Modal 上服务万亿 token,推理需求持续暴涨 — josh_wills · 2026-10-08
- OpenAI 算力「速通」:前后对比图看训练规模暴涨 — ns123abc · 2026-10-08
- VraserX:理想 AI 是跑在手机、眼镜上的端侧小模型,陪你成长十年 — VraserX · 2026-10-08