双 R9700 运行 vLLM:多实例导致吞吐减半

Certain_Series6810 · reddit · 2026-08-23

用户在双 R9700 (AMD GPU) Ubuntu 环境下对比 llama.cpp 和 vLLM。使用 llama.cpp 单实例达 40 t/s,切换到 vLLM Docker 镜像以支持多实例时,生成速度反而减半。用户询问这是否属于 vLLM 的正常行为或配置问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →