双 R9700 运行 vLLM:多实例导致吞吐减半
Certain_Series6810 · reddit · 2026-08-23
用户在双 R9700 (AMD GPU) Ubuntu 环境下对比 llama.cpp 和 vLLM。使用 llama.cpp 单实例达 40 t/s,切换到 vLLM Docker 镜像以支持多实例时,生成速度反而减半。用户询问这是否属于 vLLM 的正常行为或配置问题。
「Infra」频道最新
- 47 美元运行 DeepSeek-V3:剪枝加量化实现 47 tok/s — StefanoGogioso · 2026-08-23
- 呼吁让顶尖建筑师设计数据中心外观 — EddyVGG · 2026-08-23
- 预测市场:明年底前发射太空数据中心概率 25% — Polymarket · 2026-08-23
- 风投提议在美墨边境建巨型数据中心网络 — Polymarket · 2026-08-23
- 实验计划:Mac 本地跑 Qwen 模型对抗云端安全扫描 — natesiggard · 2026-08-23
- 12GB 显存最佳模型推荐:除了 GLM 4.7 Flash 还有什么? — OrangeThink5911 · 2026-08-23