llama.cpp 能否跨卡共享 KV 缓存处理多请求?
spaceman_ · reddit · 2026-08-22
用户探索在 4 张 AMD R9700 GPU 上运行 Qwen3.8-27B,希望利用多卡并行处理请求。简单测试表明 PCIe 通信瓶颈导致单请求跨卡无加速。难点在于多实例运行无法共享 KV 缓存,若会话请求路由到不同卡会导致缓存失效。用户询问是否存在类似 split mode 的设置,能在多卡上加载权重并共享 KV 缓存。
「Infra」频道最新
- 如何让 llama.cpp 正确支持多 GPU 显存 — erazortt · 2026-08-22
- AMD 显卡建议升级至 ROCm 7.10 — Present-Guitar-3967 · 2026-08-22
- FreeToken 实测:4090级显卡跑35B模型达100 tok/s — ViRROOO · 2026-08-22
- Ox Alpha 每天送出 100T tokens:算力成本达百万美元级 — teortaxesTex · 2026-08-22
- 企业 OpenAI 账单失控,求荐统一 AI 网关方案 — HurryOrganic · 2026-08-22
- Agent 静默失败跑出 4.7 万账单,传统监控已失效 — alifgokce · 2026-08-22