本地部署科普:如何将两台电脑的显存合并运行大模型

Guyserbun007 · reddit · 2026-08-08

网友提问:如果运行一个大模型需要 17GB 显存,但手头有两台各带 12GB 显存的电脑,能否将两者的显存合并使用?

答案是可以的。 在本地部署和推理中,可以通过分布式推理框架来实现跨设备的显存池化。常见方案包括使用 vLLM、Ray 或 DeepSpeed 等工具。这些框架允许将模型的不同层分配到不同机器的 GPU 上(即流水线并行 Pipeline Parallelism),从而突破单卡显存限制。但需要注意的是,由于跨设备通信(通常依赖局域网)的带宽延迟远低于主板内的 PCIe/NVLink,这种做法会显著降低推理速度(token 生成速度会变慢)。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →