蚂蚁灵波开源LingBot视觉基座,深度感知斩获多项第一

蚂蚁集团旗下具身智能公司蚂蚁灵波正式发布并开源了面向机器人的视觉基础模型家族 LingBot-Vision,以及深度感知模型 LingBot-Depth 2.0。此次开源的 LingBot-Vision 采用 Apache-2.0 协议,提供从 21M 到 1.1B(ViT-S 至 ViT-g)四种尺寸的骨干网络。该模型在多项密集空间感知任务中表现突出,LingBot-Depth 2.0 更是在行业公开及私有数据集中斩获 12 项世界第一。这一发布标志着具身智能在底层视觉感知能力上取得了重要突破,值得行业关注。

技术创新与核心优势

LingBot-Vision 属于 DINO 谱系的自监督视觉骨干,其核心创新在于「掩码边界建模」。据 @StillThese3747 与 @Illustrious-Data1712 解读,该机制通过教师模型在线预测密集边界场,将包含边界的 token 强制纳入学生网络的掩码中,迫使学生模型重建无法靠上下文推断的区域。这种设计无需人工标注或外部边缘检测器,使模型更偏向几何与稠密空间结构。训练数据方面,模型使用了从 2B 原始图片中过滤出的 1.61 亿张图像。

性能表现与数据扩展

在性能上,@thetripathi58 指出 1B 版本的 LingBot-Vision 在 NYU-Depth v2 基准上的深度估计 RMSE 低于 Google SigLIP 2 和 NVIDIA AM-RADIO,整体深度估计能力较 Google 提升约 40%,并在 ADE20K 分割上增加 10.8 mIoU。此外,该模型展现出优异的缩放特性:@AdinaYakup 提到其 1.1B 参数模型超越了 7B 的 DINOv3;@thetripathi58 补充称,当深度训练数据扩大至 1.5 亿样本时,模型初始化效果持续提升,且蒸馏至 0.3B 的学生模型在边缘设备上依然表现优异。

攻克复杂场景与开源策略

针对实际机器人场景,LingBot-Depth 2.0 重点解决了深度图在透明/反光材质、小目标及弱光环境下的破碎与空洞问题。@Ok-Line2658 分析其思路是将传感器在镜面高光、无纹理区产生的无效深度直接作为掩码信号进行训练。在开源策略上,@thetripathi58 确认 LingBot-Vision 已开放权重与代码,但下游的 LingBot-Depth 2.0 目前保持闭源。

2026-07-07 ~ 2026-07-08 · 18 条相关

一手来源

另有 1 条近重复转述:AdinaYakup