用脚本优化 llama.cpp 双 GPU 显存分配提升上下文

ea_man · reddit · 2026-08-31

作者分享了一种优化 llama.cpp 在双 GPU 下显存分配的方法。常规按比例(如 0.6, 0.4)分配不够精确,通过手动调整 --override-tensor 移动特定张量,可将 Qwen 模型的上下文长度从 110848 提升至 139776。作者提供了自动探测最佳组合的脚本工具,支持 ROCm 和 Vulkan,并给出了在 KV 缓存保存下进行测试的工作流。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →