InstructSAM 迁移到 C++/GGUF,本地跑 Qwen3-VL 分割
remyxai · reddit · 2026-07-25
InstructSAM 正在被移植到 C++/GGUF 以支持本地多模态推理
作者在一个多模态数据合成流水线里,原本用 VLM 负责 captioning、用分割模型负责 2D 定位。后来他找到 InstructSAM:一个在 Qwen3-VL-2B 基础上加了 SAM3 分割头 的方案。
借助这种架构,他可以把原来“两阶段、两个模型”的流程,简化成“单个更小模型的两次推理”。但现实问题也很明显:他当前的流水线依赖 llama.cpp 上的 4-bit 量化权重,而给模型加上分割头意味着它需要输出图像,这对项目来说是一次不小的改动。
于是他 fork 了一个更适配 SAM3 的相关仓库,补上 llama.cpp 依赖,并把 InstructSAM 迁移到 C++ + GGUF。仓库里还附了 Dockerfile,方便构建和转换,同时尽量满足现有许可证约束。
「编程与Agent」频道最新
- 开源 Agent Skill 2.3k 星:生成 MVP 蓝图并审计重构 agentic harness — tom_doerr · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11
- 首届 Three.js 大会落地巴黎,AI 正缩短从想法到原型的距离 — OdinLovis · 2026-09-11
- 观点:Agent 真正的瓶颈是企业数据工程能力 — dhruv2038 · 2026-09-11
- 实测戳破 RTK 省钱神话:token 省了,账单分文未降 — Bartaseth · 2026-09-11
- GPT-6 Astra 用时 44 小时通关含敌人 Factorio,API 成本约 4500 美元 — liminal_bardo · 2026-09-11