如何让 llama.cpp 正确支持多 GPU 显存

erazortt · reddit · 2026-08-22

用户在尝试使用 llama.cpp 跨越两张 GPU(一张 Blackwell 5000 48GB 和一张 3090 24GB)运行 Deepseek V3 的 120GB 量化模型时遇到性能瓶颈。尝试了包括 --split-mode layer、手动分配层张量到不同 GPU 以及调整张量并行等多种方案,但要么显存分配失败,要么推理速度反不如单卡。用户寻求关于如何正确配置多 GPU 卸载以提升性能的解决方案。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →