拆分 GPU 虚拟机,Ollama 推理速度提升约 3 倍
NicolaZanarini533 · reddit · 2026-08-24
作者分享了优化 Ollama 推理性能的实践经验:将原本在单个虚拟机中池化的 3 张 GPU(2x RTX PRO 4000, 1x RTX PRO 2000)拆分为两个虚拟机(一张独占,两张池化)。测试结果显示,Qwen2.5-72B 的生成速度从 12.2 tok/s 提升至 33.91 tok/s,muse-glimmer-30B 也有显著提升。这一改动打破了“池化速度差异不大”的惯性思维,证明了资源隔离在高负载下的优势。
「Infra」频道最新
- 富国银行:博通 FY28 AI 芯片营收将达 2053 亿美元 — Beth_Kindig · 2026-08-24
- Disaggregated LPDDR 内存:AI 算力基础设施的新解法 — jwt0625 · 2026-08-24
- 投机解码学习笔记:draft-and-verify 如何无损加速 LLM 推理 — helloiamleonie · 2026-08-24
- AI芯片全球电力需求暴增1100%,美国独占六成 — KyeGomezB · 2026-08-24
- 3080显存超频至+1200,Flux生图效率实测提升 — MakionGarvinus · 2026-08-24
- 开源平台xyOps集成调度、自动化与监控三大功能 — tom_doerr · 2026-08-24