拆分 GPU 虚拟机,Ollama 推理速度提升约 3 倍

NicolaZanarini533 · reddit · 2026-08-24

作者分享了优化 Ollama 推理性能的实践经验:将原本在单个虚拟机中池化的 3 张 GPU(2x RTX PRO 4000, 1x RTX PRO 2000)拆分为两个虚拟机(一张独占,两张池化)。测试结果显示,Qwen2.5-72B 的生成速度从 12.2 tok/s 提升至 33.91 tok/s,muse-glimmer-30B 也有显著提升。这一改动打破了“池化速度差异不大”的惯性思维,证明了资源隔离在高负载下的优势。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →