RTX 6000 加载需 10 分钟?开发者排查 ComfyUI 推理瓶颈
buttplugs4life4me · reddit · 2026-08-04
一位 DevOps 工程师反馈,在使用 NVMe 和 RTX Pro 6000 显卡运行 ComfyUI 时,遇到了严重的性能瓶颈,单次生成加载时间超过 10 分钟。
排查发现,ComfyUI 似乎在将模型转移到 VRAM 之前,会先将整个模型加载到系统 RAM 中。在此过程中,CPU、存储、RAM 和 GPU 均未被充分利用。相比之下,使用 vLLM 或 llama.cpp 加载类似大小(32GB)的 LLM 模型只需 30 秒到 2 分钟。
作者吐槽 ComfyUI 的部署体验极其复杂,包含大量难以协同的 CLI 参数,且缺乏有效的调试日志。对于专业运维人员来说,这也是他们部署过的最困难的项目之一。
「Infra」频道最新
- Mach-1模型1.7比特权重推理:7GB显存跑出120 tokens/秒 — pbaylies · 2026-08-04
- 用 Rust 给开源模型做手术:极致优化推理性能的实践分享 — doodlestein · 2026-08-04
- Anthropic向成立仅半年的云初创Volta锁定百亿美元算力 — The Decoder · 2026-08-04
- Ling-3.0-flash 开源:127B 参数 MoE 架构,官方 FP8 仅需 128GB — derspenti · 2026-08-04
- 美拟禁中国光模块,博主称反将助推国产 AI 硬件升级 — bookwormengr · 2026-08-04
- 8x 5090 跑 DeepSeek V4 Flash:并发 50 且成本仅 2.5 美元/时 — Hodler-mane · 2026-08-04