InstructSAM 迁移到 C++/GGUF,本地跑 Qwen3-VL 分割

remyxai · reddit · 2026-07-25

InstructSAM 正在被移植到 C++/GGUF 以支持本地多模态推理

作者在一个多模态数据合成流水线里,原本用 VLM 负责 captioning、用分割模型负责 2D 定位。后来他找到 InstructSAM:一个在 Qwen3-VL-2B 基础上加了 SAM3 分割头 的方案。

借助这种架构,他可以把原来“两阶段、两个模型”的流程,简化成“单个更小模型的两次推理”。但现实问题也很明显:他当前的流水线依赖 llama.cpp 上的 4-bit 量化权重,而给模型加上分割头意味着它需要输出图像,这对项目来说是一次不小的改动。

于是他 fork 了一个更适配 SAM3 的相关仓库,补上 llama.cpp 依赖,并把 InstructSAM 迁移到 C++ + GGUF。仓库里还附了 Dockerfile,方便构建和转换,同时尽量满足现有许可证约束。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →