RIPE++: Reinforced Keypoint Learning from Positive Pairs Only
Johannes Künzel, Peter Eisert, Anna Hilsmann
ECCV 2026
cs.CV, cs.LG
2026-08-20
Fraunhofer HHI把RIPE粗粒度二值奖励改成正样本对上的内点奖与外点罚,从而去掉负对;MegaDepth1500上AUC@5从53.47升到56.58,接弱监督LightGlue后再到59.65。
学稀疏关键点通常要相机位姿或深度。这些监督来自标定硬件或离线SfM,医学内镜这类场景经常拿不到。RIPE用强化学习,只要求一对图是不是同一场景,靠RANSAC估计基础矩阵当奖励。还剩两个坑。奖励是图对级的二值信号,训练不稳、描述子不够可分,还得精心构造负对。匹配器本身仍要位姿或深度,弱监督在匹配这一步又断了。
沿用RIPE:网络出热图,格子里按类别分布采一个点,描述子从encoder超列取出。REINFORCE用奖励矩阵给采样点的对数概率加权。
改动在奖励。RIPE对正对只奖RANSAC内点,负对把奖励反号;外点被忽略,网络可以乱匹配,只要RANSAC滤掉就拿中性梯度。RIPE++只用正对,对互近邻匹配里的每个对应分别打分:内点ρin=1.0,外点ρout=-0.1,没匹配上的给很小的λ。对比信号来自同一对图里的几何一致和不一致,负对可以扔。
热图用负熵替代原来只压低选中点的正则,逼每个格子接近one-hot,低分辨率下定位才尖。描述子仍用RIPE的对比损失。检测损失是期望奖励的负值。
同一套奖励接到LightGlue上:把部分分配矩阵拆成匹配概率和可匹配概率,对RANSAC内点奖、外点罚,再加一项防止网络把所有点标成不可匹配。不采样,期望可闭式算。
训练用MegaDepth的DISK/LightGlue子集,只要图对。医学实验从SCARED视频隔60帧取样,得到17514对,不加位姿。提点器是VGG-19,单卡A100训26小时,RIPE要72小时,因为正对上RANSAC可以早停。
MegaDepth1500,互近邻匹配,top-2048点:
| 方法 | AUC@5° | 监督 |
| RIPE | 53.47 | 正+负对 |
| RIPE++ | 56.58 | 仅正对 |
| ALIKED | 56.66 | 位姿+单应 |
| SuperPoint | 47.26 | 单应 |
| DISK | 50.69 | 位姿/深度 |
RIPE++比RIPE高3.11个点,和全监督ALIKED只差0.08。RaCo报到57.96,描述子来自监督的ALIKED。接弱监督LightGlue后AUC@5到59.65;全监督LightGlue配ALIKED是66.1,还差一截。
SCARED1500上零样本都崩。用内镜视频重训的RIPE++ Medical:AUC@5为20.90,超过SuperPoint的19.01和RaCo的19.35。消融里,只改正奖励就把RANSAC内点数从297.5提到427.5;熵权重1e-6再把AUC@5从52.42抬到56.59,1e-4会直接训崩。
监督从「位姿+深度」降到「这两帧大概有重叠」。视频流就能当训练集。医学场景里COLMAP经常失败,这条路能训出专用提点器。匹配器也能弱监督,整条稀疏匹配管线可以只靠图对走通。数字上这是渐进:自然图上刚追上ALIKED,匹配器离全监督还有6个点以上。真正的产品价值在能在没有几何真值的域里重训。
几何模型假定刚体和针孔相机,非刚性组织形变不在公式里。奖励绑在基础矩阵RANSAC上,重叠太少或运动退化时奖励会噪。熵权重极敏感。零样本不跨域,正对奖励会特化到训练分布。匹配器仍低于全监督6.45个AUC@5点。SCARED1500是作者自建的评测切分。补充材料里的Sampson距离奖励和课程学习没有进主结果。