Ollama 推理仅 20 tok/s,瓶颈在 UI 层还是模型?

daddyMaterialBolte · reddit · 2026-08-23

用户在公司内部部署 NVIDIA Nemotron + Ollama + OpenWebUI/AnythingLLM 时,遇到生成速度约 20 tokens/sec 且 GPU 占用 95% 的情况,试图定位高延迟来源。

用户已确认模型本身 GPU 利用率高,怀疑瓶颈可能在于中间层(如 UI 的 prompt 构造、RAG、API 调用开销)。寻求以下问题的解答:

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →