免训练从分割掩码估单应性,PlanarTrack上p@5高出18.4点

Segmentation-Guided Homography Estimation for Long-Term Planar Tracking

Jonas Serych, Jiri Matas

ECCV 2026

cs.CV

2026-02-23

捷克理工用霍夫变换从SAM 2掩码轮廓估8自由度单应性;SAM-H在PlanarTrack上p@5比先前最优高出18.4个百分点,再与光流结合的WOFTSAM拿下POT-210新高。

这篇在解决什么

平面物体跟踪要的不是框,是 8 自由度单应性:当前帧里这块平面相对第一帧怎么翘、怎么转、怎么近。增强现实、影视后期、视觉伺服都靠这个几何量。通用分割跟踪器如 SAM 2 已经能在模糊、反光、外观会变的目标上给出稳定掩码,但掩码只告诉你「这块区域是它」,给不出四个角的对应关系。

现有单应性跟踪器走的是另一条路:关键点、光流、直接对齐。纹理清楚、目标一直在画面里时,精度很高。目标出画、被挡住、表面像镜子或电视屏幕那样在变,对应关系就断了,而且断了往往回不来。PlanarTrack 这类更野的基准把这些情况叠在同一段视频里,先前最优 WOFT 的 p@5 只有 43.6%。

要从掩码恢复单应性也不直白。四边形绕一圈换角,形状不变,四个候选单应性掩码上看不出来。遮挡时边还不齐。

方法

SAM-H 是一条免训练的几何管线,吃的是分割跟踪器的逐帧掩码。用 SAM 2.1 的 hiera-tiny,并采用 DAM4SAM 里两条改动:记忆时间步长设为 5,目标不在画面里时不更新记忆。

步骤是:

WOFTSAM 再把这条管线接到光流跟踪器 WOFT 上,做成三级级联。先用上一帧单应性预扭曲当前帧,跑 Weighted Flow Homography。内点比例低于 20% 时,改用 SAM-H 的单应性做预扭曲再估一次。还不行,就退回 SAM-H。对应关系在纹理可见时更准,分割负责丢了之后把它找回来。

结果

PlanarTrackTST 上,SAM-H 的 p@5 / p@15 是 62.0 / 80.0,WOFT 是 43.6 / 64.8,p@5 高出 18.4 个百分点。WOFTSAM 是 51.5 / 77.2,超过所有先前方法,但在这个更难的基准上仍低于纯 SAM-H。

POT-210 是高精度赛道,先前方法 p@15 已经超过 95%。WOFTSAM 以 91.9 / 97.5 超过 WOFT 的 90.0 / 95.4 和 HVC-Net 的 91.4 / 95.8。单独的 SAM-H 在这里只有 64.4 / 89.0,掩码边界到不了 5 像素精度。增益主要来自模糊、遮挡和 unconstrained 序列。

方法POT-210 p@5POT-210 p@15PlanarTrack p@5PlanarTrack p@15
HVC-Net91.495.842.063.1
WOFT90.095.443.664.8
WOFTSAM91.997.551.577.2
SAM-H64.489.062.080.0

MPOT-3K 上 WOFTSAM 的 p@50 是 95.1,高于专为该数据集设计的 PRTrack 的 92.85。按序列在 SAM-H 和 WOFTSAM 之间做预言机选择,PlanarTrack 的 p@15 能到 86.9。他们还重标了 PlanarTrack 初始帧,原始初始标注相对新标注平均差 1.9 像素,却能解释 WOFTSAM 与 SAM-H 在 p@5 上超过一半的分差。RTX A5000 上 WOFTSAM 约 2.4 FPS。

为什么重要

平面跟踪的瓶颈很大一块是丢了找不回来,不是纹理在的时候估不准。SAM 2 已经能跟上反光、透明、电视画面这类目标,把掩码轮廓变成单应性,不用为这个任务再训一个网络。影视后期这种不要求实时的场景可以直接用。POT-210 也说明,要 5 像素精度,还是得把光流对应接回来。两条路线互补,级联已经够用,更紧的融合还没做完。

局限与存疑

SAM-H 默认目标近似四边形,边界上凑不齐四条稳定直线就会失败。遮挡物如果自身也是直线,掩码仍像四边形,单应性会被安在可见残缺上。镜子一类目标上,光流会自信地跟上反射里的另一个平面,内点比例检查发现不了。SAM 2 有时会从指定的平面「溢」到整个三维物体。WOFTSAM 的内点启发式会漏掉这些情况。2.4 FPS 够后期,不够闭环伺服。PlanarTrack 的逐帧标注仍粗,只修了第一帧。

术语

原文与代码

社区讨论

相关论文

全部论文解读