5 台双 L40 主机 vLLM 部署后,每卡约 5GB 显存闲置如何利用?

gulensah · reddit · 2026-08-18

Reddit 运维场景讨论:用户管理 5 台物理主机(每台两张 NVIDIA L40),用 Proxmox 虚拟化 + GPU 直通到 Ubuntu VM,每张卡上以 Docker 跑多个 vLLM 实例承载不同大小的模型。目前每卡显存占用约 90%,剩余约 5GB 闲置。由于各卡模型大小不一,无法靠调配模型实现 100% 利用,他询问是否有优雅方案能跨卡利用这些碎片显存。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →