旧显卡别吃灰:单独挂一块 GPU 跑 mmproj,多模态推理快一个量级

inthesearchof · reddit · 2026-09-12

作者分享 llama.cpp 本地多模态部署的实用技巧:常见建议是用 --no-mmproj-offload 把视觉投影(mmproj)留在 GPU 上以省显存,但在跑 agentic coding 时速度极慢。更好的做法是把一块闲置低显存旧 GPU 单独用作 mmproj 处理器,通过 --mmdev CUDA1(对应 GPU 编号) 挂载,这样比 --no-mmproj-offload 快约一个数量级,且不影响主模型的推理速度。适合显存吃紧又需要视觉能力的本地部署用户。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →