InstructSAM 迁移到 C++/GGUF,本地跑 Qwen3-VL 分割
remyxai · reddit · 2026-07-25
InstructSAM 正在被移植到 C++/GGUF 以支持本地多模态推理
作者在一个多模态数据合成流水线里,原本用 VLM 负责 captioning、用分割模型负责 2D 定位。后来他找到 InstructSAM:一个在 Qwen3-VL-2B 基础上加了 SAM3 分割头 的方案。
借助这种架构,他可以把原来“两阶段、两个模型”的流程,简化成“单个更小模型的两次推理”。但现实问题也很明显:他当前的流水线依赖 llama.cpp 上的 4-bit 量化权重,而给模型加上分割头意味着它需要输出图像,这对项目来说是一次不小的改动。
于是他 fork 了一个更适配 SAM3 的相关仓库,补上 llama.cpp 依赖,并把 InstructSAM 迁移到 C++ + GGUF。仓库里还附了 Dockerfile,方便构建和转换,同时尽量满足现有许可证约束。
「编程与Agent」频道最新
- img2threejs 让 AI 编程代理直接做程序化 3D 生成 — anselm · 2026-07-25
- Codex 和 Three.js 做出可交互程序化房屋演示 — anselm · 2026-07-25
- Claude Opus 5 提示词经验:旧式 harness 习惯开始浪费 token — tengyanAI · 2026-07-25
- T3 Code 一周合并 76 个 PR,加入 Opus 5 和自动审批 — TAbrodi · 2026-07-25
- 一个编程 agent 跑了两条命令,又把事实存进记忆 — sull · 2026-07-25
- 一个编程 agent 面板追踪 19 亿 token 和 2595 美元支出 — zeeg · 2026-07-25