解读 LingBot-Vision 的掩码边界建模

Illustrious-Data1712 · reddit · 2026-07-07

进一步解读 Robbyant 开源的 LingBot-Vision:架构属于 DINO 谱系,但引入了"掩码边界建模"——教师在线预测密集边界场,携带边界的 token 被强制纳入学生掩码;边界场被转为逐像素类别分布以保持自蒸馏稳定,分割结果通过"反证法"验证,全程无需标签、文本监督或外部边缘检测器。

训练仅用 1.61 亿张精选图像,不到 DINOv3 训练样本的三分之一。自测显示 1.1B 的 ViT-g 在 NYUv2 深度估计 RMSE 0.296,优于 DINOv3-7B;蒸馏版 ViT-L 以约 1/23 参数量基本追平 DINOv3-7B。权重已在 HuggingFace 和 GitHub 直接开放。

所属事件:蚂蚁灵波开源LingBot视觉基座,深度感知斩获多项第一(18 条相关)→

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →