CrossFeat: Bridging Imaging Modalities in Feature Descriptor Space
Paul Schneider, Nazim Haouchine
ECCV 2026
cs.CV
2026-09-01
在描述子空间把外观映射到目标模态,几何码保持不动,原有SIFT或SuperPoint就能跨模态匹配。驾驶SR@1从接近0升到73.5,卫星上多数基线为0时仍有34.0。
关键点描述子大多按单模态来训:同一相机、光照和对比度变一变就能对上。多模态完全是另一回事。MRI和超声、RGB和事件相机、光学卫星和SAR,同一块结构长得不像。常见做法是给每一对模态单独训描述子,换一对就重来;或者上很大的端到端匹配网络,推理变慢。
CrossFeat不换原来的描述子。哈佛医学院布列根和妇女医院的工作把它重写成描述子空间里的一次跨越:把源模态的向量映射到目标模态能认的样子,几何结构尽量原封不动。
描述子被拆成两段隐变量。几何码是确定性的,跨模态应对齐;外观码走变分头,吸收模态自己的对比和纹理。跨越网络只改外观码:用源、目标模态嵌入生成 FiLM 仿射参数,再经残差 MLP,初始化接近恒等映射。解码器把未改的几何码和改过的外观码拼回去,并按目标模态做一次条件重建。
训练损失六项一起用:重建、几何对齐、跨越余弦、对抗模态分类(梯度反转)、外观 KL,以及 batch 内 InfoNCE。权重离线搜过大约1000次后固定,三个任务不再重调。关键点用双锚采样,源、目标各出一半,避免结构只在一种模态里显眼。推理可选测试时适应:互近邻加 RANSAC 内点做伪标签,闭式岭回归补一个残差,迭代五步。初始内点太少时,这一步会伤精度。
跨越网络大约0.5到0.6M参数,A100上每个任务训1到3小时。
三个任务、十对模态。医学在 ReMIND 上训,测 BRATS 和 RESECT;驾驶在合成 EventScape 上训,测真实 DELIVER;卫星在 WHU-OPT-SAR 上训,测 QXS-SAROPT。
稀疏匹配里,Cross(SIFT)+最近邻在医学上 SR@1 为47.0,加 TTA 到79.2,对照 SuperPoint+MINIMA-LightGlue 的37.5。驾驶上 SR@1 从基线接近0爬到73.5,TTA 到85.3。卫星上多数基线 SR@1 为0,CrossFeat 到34.0;这里 TTA 反而降到18.0,因为初始内点不稳。匹配往往更少、更准,召回不高,SR@1 和 AUC@1 却高。
稠密方法对照里,医学加 TTA 的 AUC@1 为0.96,高于 MINIMA-RoMa 的0.46;驾驶 SR@1 为85.3,对照 MINIMA-LoFTR 的32.3。卫星上稠密方法基本失效,CrossFeat 仍是唯一有稳定成功率的。单张图检测、描述、跨越、匹配大约0.5到1秒,稠密匹配大约5秒。
ReMIND 消融里,去掉 InfoNCE,SR@1 从52.9%掉到15.1%;去掉几何-外观解耦掉13.3个点。随机采样关键点会把平均匹配数从约91降到11。
已有的 SIFT、SuperPoint 不必为每一对模态重训。这对医学配准尤其实际:超声和 MRI 的外观差很大,几何轮廓还在。网络小,推理也比大号稠密匹配快一个数量级。换来的是必须告诉模型这一对是什么模态,而且它更追求内点质量,不追求匹配密度。
模态对要在推理时指定,未知或连续变化的传感就不好用。TTA 在卫星这种初始匹配很差的任务上会帮倒忙。驾驶从合成训到真实,卫星从一套SAR-光学训到另一套,泛化有,但每套任务仍要单独训一个跨越模型。论文没有把「任意N个模态一个模型」做成可部署的通用权重。召回偏低,后面如果还要密集重建,可能得再补点。