Ollama 推理仅 20 tok/s,瓶颈在 UI 层还是模型?
daddyMaterialBolte · reddit · 2026-08-23
用户在公司内部部署 NVIDIA Nemotron + Ollama + OpenWebUI/AnythingLLM 时,遇到生成速度约 20 tokens/sec 且 GPU 占用 95% 的情况,试图定位高延迟来源。
用户已确认模型本身 GPU 利用率高,怀疑瓶颈可能在于中间层(如 UI 的 prompt 构造、RAG、API 调用开销)。寻求以下问题的解答:
- OpenWebUI/AnythingLLM 是否引入了显著的额外延迟?
- 如何准确测量 TTFT、prompt 处理时间与生成时间?
- 如何系统性对比直接调用 Ollama 与通过 UI 调用的性能差异?
- 大上下文/历史记录对性能的具体影响及验证方法。
「Infra」频道最新
- Mistral 被曝 2030 年前在欧洲布局至多 1GW 算力 — emmanuelvivier · 2026-08-23
- Nvidia 部分 AI 产品涨价超 15%,内存成本飙升所致 — emmanuelvivier · 2026-08-23
- Nvidia 部分 AI 产品涨价超 15%,归因于内存芯片成本飙升 — emmanuelvivier · 2026-08-23
- AI 与 RAG 必读:新闻搜索 API 深度横向对比 — ermanos12 · 2026-08-23
- Unsloth 版 Qwen3.8-27B 移植 MTP 模式,显存占用更低 — Nyghtbynger · 2026-08-23
- 8 张 B300 跑 Kimi K3:每百万 token 成本 190 美元,附完整部署账单 — OtherRaisin3426 · 2026-08-23