解读 LingBot-Vision 的掩码边界建模
Illustrious-Data1712 · reddit · 2026-07-07
进一步解读 Robbyant 开源的 LingBot-Vision:架构属于 DINO 谱系,但引入了"掩码边界建模"——教师在线预测密集边界场,携带边界的 token 被强制纳入学生掩码;边界场被转为逐像素类别分布以保持自蒸馏稳定,分割结果通过"反证法"验证,全程无需标签、文本监督或外部边缘检测器。
训练仅用 1.61 亿张精选图像,不到 DINOv3 训练样本的三分之一。自测显示 1.1B 的 ViT-g 在 NYUv2 深度估计 RMSE 0.296,优于 DINOv3-7B;蒸馏版 ViT-L 以约 1/23 参数量基本追平 DINOv3-7B。权重已在 HuggingFace 和 GitHub 直接开放。
所属事件:蚂蚁灵波开源LingBot视觉基座,深度感知斩获多项第一(18 条相关)→
「模型」频道最新
- 曝 Meta Muse Agent 内置邀请码逻辑,或携额外免费额度上线 — testingcatalog · 2026-09-11
- 同题 Echo Maze 实测:三大模型看似成功,代码里藏着同一个 bug — eyishazyer · 2026-09-11
- 新基准一出分数暴跌 70 点:「刷榜」现象如何让跑分失真 — airesearch12 · 2026-09-11
- ChatGPT 竟劝用户「问题太复杂,去试试更笨的回答」 — phido3000 · 2026-09-11
- Anthropic 调整年龄验证,Claude 不再向未成年人开放 — Muhammad523 · 2026-09-11
- 有人要建全模型基准分数汇总页 — airesearch12 · 2026-09-11