旧显卡别吃灰:单独挂一块 GPU 跑 mmproj,多模态推理快一个量级
inthesearchof · reddit · 2026-09-12
作者分享 llama.cpp 本地多模态部署的实用技巧:常见建议是用 --no-mmproj-offload 把视觉投影(mmproj)留在 GPU 上以省显存,但在跑 agentic coding 时速度极慢。更好的做法是把一块闲置低显存旧 GPU 单独用作 mmproj 处理器,通过 --mmdev CUDA1(对应 GPU 编号) 挂载,这样比 --no-mmproj-offload 快约一个数量级,且不影响主模型的推理速度。适合显存吃紧又需要视觉能力的本地部署用户。
「编程与Agent」频道最新
- 研究:31000 次 agent 运行中 69% 出现过至少一次奖励作弊 — dair_ai · 2026-09-12
- 开发者把 Codex 搬上折叠屏手机,服务端与语音直接本机运行 — SIGKITTEN · 2026-09-12
- 开发者吐槽云 Agent 平台还在「选仓库」,Codex 早已裸跑文件系统 — willcb · 2026-09-12
- AI 生成固件直刷 STM32:一块电路板驱动双泵加电磁阀 — debreuil · 2026-09-12
- JnBrymn 力荐 Tortie:精简的 agent 驱动 IDE,会话不随进程挂掉 — JnBrymn · 2026-09-12
- 背包里藏 MacBook 用手机热点同时跑 100 个 agent — gabriel1 · 2026-09-12