5 台双 L40 主机 vLLM 部署后,每卡约 5GB 显存闲置如何利用?
gulensah · reddit · 2026-08-18
Reddit 运维场景讨论:用户管理 5 台物理主机(每台两张 NVIDIA L40),用 Proxmox 虚拟化 + GPU 直通到 Ubuntu VM,每张卡上以 Docker 跑多个 vLLM 实例承载不同大小的模型。目前每卡显存占用约 90%,剩余约 5GB 闲置。由于各卡模型大小不一,无法靠调配模型实现 100% 利用,他询问是否有优雅方案能跨卡利用这些碎片显存。
「Infra」频道最新
- Epoch AI 研究员:马斯克是唯一自建数据中心的前沿实验室 CEO — soumitrashukla9 · 2026-08-18
- AI 服务器需求致 MLCC 交付期分化,高端产品近 10 个月 — zephyr_z9 · 2026-08-18
- DeepSeek V4 Flash 调优实录:n_max=3 速度提升 39% — Responsible_Pain3278 · 2026-08-18
- 英伟达拟担保高达 1050 亿美元贷款,被质疑通过融资买芯片制造虚假增长 — heypearlai · 2026-08-18
- 推理比训练更重要:LLM 全年服务但仅训练一两次 — prajdabre · 2026-08-18
- 实测结合 MTP 与 ngram-mod 进行代码生成加速 — YetAnotherAnonymoose · 2026-08-18