llama.cpp 能否跨卡共享 KV 缓存处理多请求?

spaceman_ · reddit · 2026-08-22

用户探索在 4 张 AMD R9700 GPU 上运行 Qwen3.8-27B,希望利用多卡并行处理请求。简单测试表明 PCIe 通信瓶颈导致单请求跨卡无加速。难点在于多实例运行无法共享 KV 缓存,若会话请求路由到不同卡会导致缓存失效。用户询问是否存在类似 split mode 的设置,能在多卡上加载权重并共享 KV 缓存。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →