Bagel 微调版一个模型搞定检测、OCR、深度图与分割
mostlyired12 · reddit · 2026-09-27
SenseNova-Vision-7B-MoT 是字节 Bagel 的微调模型,总参数 14B、激活 7B。它把四大视觉任务塞进一个模型:
- 检测框和 OCR 以带坐标的纯文本返回;深度图和掩码则以生成的图像输出。
- 论文自选对比集中,该模型在目标检测和 OCR 上排名第一(OCR 一项并列),深度任务全面超过 Depth Anything V2,但多数深度基准仍落后 MoGe-2,掩码任务也多输给专用分割模型。
本地部署门槛高:README 唯一验证过的配置是一张 80GB A800,小显存卡未验证;没有 GGUF,llama.cpp 也尚不支持 Bagel。权重为非商用许可(尽管 Bagel 本体是 Apache 2.0)。作者提问:若有 GGUF 能跑进 24GB,你会用一个模型全包,还是继续用 Depth Anything + SAM + 小 VLM 的组合?
「模型」频道最新
- MLX 社区投票:前三名视觉模型全部由 MLX-VLM 驱动 — andrejusb · 2026-09-27
- 「Claude 还有什么干不了?」一句感慨引发能力边界讨论 — prasenx · 2026-09-27
- 开发者用 Claude Opus 5.5 一次生成产品宣传视频成功 — JosephJacks_ · 2026-09-27
- 疑似 GPT-6 演示:陌生房间内操控宇树 G1 记住物品并跨房间取物 — 141_1337 · 2026-09-27
- Codex 额度重置时间悄悄提前,用户睡前屯额度落空 — yihui_indie · 2026-09-27
- Pedro Domingos:AI 无需版本发布,模型应持续进化 — pmddomingos · 2026-09-27