llama-server多卡负载均衡求助:MI50能否实现轮询分发
HlddenDreck · reddit · 2026-09-01
用户在本地用三块 AMD MI50 跑 llama-server,因 PCIe 3.0 带宽不足且卡不在同一 NUMA 节点,张量并行太慢。他想给每块 GPU 各跑一个相同模型实例,由服务端做轮询(请求1到卡1、请求2到卡2),但不想在客户端配置多个端口做负载均衡。发帖询问 llama-server 本身能否实现,或是否需要中间件方案。
「Infra」频道最新
- AI 如何赋能能源基础设施:预测维护与数字孪生 — ingliguori · 2026-09-02
- NVIDIA 助力 MiniMax H3 视频生成提速 27 倍 — DavidmComfort · 2026-09-02
- 沙特 HUMAIN 携手 Minio,共建 AI 原生数据基础设施 — HUMAIN · 2026-09-02
- 做本地 AI 视频生成,64GB 统一内存够用吗? — KaiwenKHB · 2026-09-02
- Deepseek Flash 模型部署时出现死循环和乱码 — Best_Sail5 · 2026-09-02
- 卫报:数据中心遭欧洲抵制,欧盟寻求绿色方案 — nordicinst · 2026-09-02