PyTorch 深度解析:为什么不应释放 Pinned Memory

ezyang · x · 2026-08-10

PyTorch 核心贡献者 Edward Yang 分享了一篇关于 CUDA Pinned Memory(页锁定内存)底层机制的深度技术文章。文章由 Claude 辅助起草并经人工编辑。

文章指出,尽管传统观点认为应像普通内存一样按需分配和释放 Pinned Memory,但在实际的高性能计算场景中,永远不释放它才是最优解。核心原因包括:

作者提到,像 Megatron-LM 和 vLLM 这样的主流大模型框架,实际上都在进程启动时预分配了专属的 Pinned Memory 池,并一直持有直到进程结束,甚至提供了专门的配置项来阻止系统释放这些内存。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →