无需预测数值:RefineAny3D 借 VLM 视觉对齐优化单目 3D 检测

kwangmoo_yi · x · 2026-08-12

RefineAny3D 提出了一种全新的单目 3D 目标检测深度优化方法。作者发现,当前的深度基础模型虽然具备强大的零样本泛化能力,但在物体级别的精度上无法满足 3D 检测的需求。

论文的核心洞察是:深度误差在图像空间中有直接的视觉特征——如果 3D 边界框投影到图像上时与目标贴合,说明深度准确;如果投影太小或太大,则说明距离太远或太近。

基于此,作者将深度优化转化为一个视觉对齐问题而非数值回归问题。具体做法是微调视觉语言模型(VLM),通过引入动作 token(action tokens)来替代数值深度输出,让模型做出分类决策,并在大规模思维链数据集上进行监督训练。

所属事件:RefineAny3D借微调VLM提升单目3D检测精度(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →