Segmentation-Guided Homography Estimation for Long-Term Planar Tracking
Jonas Serych, Jiri Matas
ECCV 2026
cs.CV
2026-02-23
捷克理工用霍夫变换从SAM 2掩码轮廓估8自由度单应性;SAM-H在PlanarTrack上p@5比先前最优高出18.4个百分点,再与光流结合的WOFTSAM拿下POT-210新高。
平面物体跟踪要的不是框,是 8 自由度单应性:当前帧里这块平面相对第一帧怎么翘、怎么转、怎么近。增强现实、影视后期、视觉伺服都靠这个几何量。通用分割跟踪器如 SAM 2 已经能在模糊、反光、外观会变的目标上给出稳定掩码,但掩码只告诉你「这块区域是它」,给不出四个角的对应关系。
现有单应性跟踪器走的是另一条路:关键点、光流、直接对齐。纹理清楚、目标一直在画面里时,精度很高。目标出画、被挡住、表面像镜子或电视屏幕那样在变,对应关系就断了,而且断了往往回不来。PlanarTrack 这类更野的基准把这些情况叠在同一段视频里,先前最优 WOFT 的 p@5 只有 43.6%。
要从掩码恢复单应性也不直白。四边形绕一圈换角,形状不变,四个候选单应性掩码上看不出来。遮挡时边还不齐。
SAM-H 是一条免训练的几何管线,吃的是分割跟踪器的逐帧掩码。用 SAM 2.1 的 hiera-tiny,并采用 DAM4SAM 里两条改动:记忆时间步长设为 5,目标不在画面里时不更新记忆。
步骤是:
WOFTSAM 再把这条管线接到光流跟踪器 WOFT 上,做成三级级联。先用上一帧单应性预扭曲当前帧,跑 Weighted Flow Homography。内点比例低于 20% 时,改用 SAM-H 的单应性做预扭曲再估一次。还不行,就退回 SAM-H。对应关系在纹理可见时更准,分割负责丢了之后把它找回来。
PlanarTrackTST 上,SAM-H 的 p@5 / p@15 是 62.0 / 80.0,WOFT 是 43.6 / 64.8,p@5 高出 18.4 个百分点。WOFTSAM 是 51.5 / 77.2,超过所有先前方法,但在这个更难的基准上仍低于纯 SAM-H。
POT-210 是高精度赛道,先前方法 p@15 已经超过 95%。WOFTSAM 以 91.9 / 97.5 超过 WOFT 的 90.0 / 95.4 和 HVC-Net 的 91.4 / 95.8。单独的 SAM-H 在这里只有 64.4 / 89.0,掩码边界到不了 5 像素精度。增益主要来自模糊、遮挡和 unconstrained 序列。
| 方法 | POT-210 p@5 | POT-210 p@15 | PlanarTrack p@5 | PlanarTrack p@15 |
| HVC-Net | 91.4 | 95.8 | 42.0 | 63.1 |
| WOFT | 90.0 | 95.4 | 43.6 | 64.8 |
| WOFTSAM | 91.9 | 97.5 | 51.5 | 77.2 |
| SAM-H | 64.4 | 89.0 | 62.0 | 80.0 |
MPOT-3K 上 WOFTSAM 的 p@50 是 95.1,高于专为该数据集设计的 PRTrack 的 92.85。按序列在 SAM-H 和 WOFTSAM 之间做预言机选择,PlanarTrack 的 p@15 能到 86.9。他们还重标了 PlanarTrack 初始帧,原始初始标注相对新标注平均差 1.9 像素,却能解释 WOFTSAM 与 SAM-H 在 p@5 上超过一半的分差。RTX A5000 上 WOFTSAM 约 2.4 FPS。
平面跟踪的瓶颈很大一块是丢了找不回来,不是纹理在的时候估不准。SAM 2 已经能跟上反光、透明、电视画面这类目标,把掩码轮廓变成单应性,不用为这个任务再训一个网络。影视后期这种不要求实时的场景可以直接用。POT-210 也说明,要 5 像素精度,还是得把光流对应接回来。两条路线互补,级联已经够用,更紧的融合还没做完。
SAM-H 默认目标近似四边形,边界上凑不齐四条稳定直线就会失败。遮挡物如果自身也是直线,掩码仍像四边形,单应性会被安在可见残缺上。镜子一类目标上,光流会自信地跟上反射里的另一个平面,内点比例检查发现不了。SAM 2 有时会从指定的平面「溢」到整个三维物体。WOFTSAM 的内点启发式会漏掉这些情况。2.4 FPS 够后期,不够闭环伺服。PlanarTrack 的逐帧标注仍粗,只修了第一帧。