llama.cpp处理长上下文显存暴涨,开发者求助优化

WizardlyBump17 · reddit · 2026-08-14

一位开发者在本地使用 Intel Arc B580 显卡通过 SYCL 跑 llama.cpp 时遇到了显存瓶颈。模型加载时显存占用为 10.7GB,但一旦发送 Prompt,显存会立刻跳升至 11.6GB。随着对话上下文变长,显存占用会逐渐吃满 12GB 甚至导致崩溃。

作者对比发现,如果切换到 Vulkan 后端,显存占用虽然能保持平缓,但推理速度却大幅下降。他附上了自己运行 Qwen 模型的 Docker 配置参数,向社区求助确认这是否是 Nvidia 和 AMD 显卡的通病,以及如何优化处理长上下文时的显存增长问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →