6M 参数单目深度模型 DepthART:ACMMM 2026 收录,224² 输入 0.918ms
机器之心 · wechat · 2026-10-03
DepthART(Depth Anything Rethought for Tiny Models) 已被 ACM Multimedia 2026 接收,研究把基础单目深度估计能力压到约 6M 参数级别,同时保留跨场景泛化与端侧部署能力。
两个核心问题与解法
- 小模型先暴露的是数据问题:多源训练数据分布不均,6M 级模型容量有限,高频数据会挤占表示能力导致「学偏」。为此提出抗偏置数据采样(BRDS):从约 4400 万张多源候选图像出发,按视觉特征空间密度降低高密度重复样本采样概率、保留稀疏区域,得到约 170 万张更均衡数据;再用 DepthAnything V2-L 生成伪深度监督,把相对深度先验蒸馏进 TinyViM+DPT 小模型。
- 度量深度微调易「遗忘」:小模型在 NYUD/KITTI 全量微调会覆盖通用几何表示。提出相机条件化微调(CamFT):冻结蒸馏后的编码器,用轻量相机适配模块引入内参,配合多查询尺度估计头恢复真实尺度——先保护几何,再学尺度。
性能与部署
- 提供 S/B/L 三档:6.0M / 11.4M / 32.6M 参数。DepthART-S 在 NYUDv2 零样本相对深度 δ1=0.964,DepthART-L 在 ETH3D δ1=0.958;DepthAnything V2-S 约 24.8M 参数,DepthART-S 仅其约四分之一。
- strict FP32 下 DepthART-S 在 RTX A6000、224² 输入约 347 FPS;TensorRT FP16 版 224 输入 model-only 延迟降至 0.918ms。提供 PyTorch、ONNX、TensorRT 及 Jetson Orin NX 部署路径。
后续扩展
- 2026 年 9 月新增 MobileNetV4-S/M 及 MobileNetV4-M-slim-SPF(裁剪编码器 + 更轻的 Single-Path Pyramid Fusion 替代 DPT 解码器):slim-SPF 约 6.05M 参数、3.78 GMAC,NYUD δ1 仅从 0.953 降至 0.952,KITTI 从 0.931 降至 0.928,算量减半而性能基本保留;且仅依赖标准 ONNX 算子,便于移植到早期 BPU/NPU。
- 作者指出轻量深度估计正成为独立方向:ZipDepth(7/9)、DepthART(7/19)与 Ultralytics YOLO26-Depth(7/22)几乎同期出现,竞争从「把基础模型做大」转向「把基础能力带到设备上」。
论文与代码、权重均已开源。
「具身」频道最新
- Model Y 车主高速突发胸痛,儿子远程改目的地由 FSD 送医 — XFreeze · 2026-10-04
- 人形机器人:一周 168 小时供应 8700 工时,远超人类 2000 小时 — elonmusk · 2026-10-04
- 开发者设计能捕捉全身动作的智能服装,运动数据可直接采集 — Scobleizer · 2026-10-04
- Shift Robotics 推出 Moonwalkers Dusk 电动鞋:10 步学会你的步态,售价 1199 美元 — Scobleizer · 2026-10-04
- Anthropic 测算:机器人仅 0.3% 美国工时具成本竞争力 — VraserX · 2026-10-04
- Steam Frame 上手评测出炉:亮点不少但也有明显槽点 — smtabatabaie · 2026-10-04