llama-server多卡负载均衡求助:MI50能否实现轮询分发

HlddenDreck · reddit · 2026-09-01

用户在本地用三块 AMD MI50 跑 llama-server,因 PCIe 3.0 带宽不足且卡不在同一 NUMA 节点,张量并行太慢。他想给每块 GPU 各跑一个相同模型实例,由服务端做轮询(请求1到卡1、请求2到卡2),但不想在客户端配置多个端口做负载均衡。发帖询问 llama-server 本身能否实现,或是否需要中间件方案。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →