ReFlowSET: Representation-Aligned Latent Flow Matching for SAR-to-EO Image Translation
Jeonghyeok Do, Seungchul Lee, Munchurl Kim
cs.CV
2026-09-01
KAIST发现雷达转光学一直默认继承自然图像编解码器。先做重建审计再从零训练条件生成器,配对数据上分布距离从71.8降到66.3,感知指标从0.211降到0.185。
合成孔径雷达全天时、多数气象下都能看地球,相干成像带来斑点和几何畸变,人眼不如光学影像好读。SAR-to-EO做的是从雷达观测生成可读的光学外观。早期GAN纹理不稳、物体语义会错;扩散更稳,近年潜空间方法为了省算力,直接继承Stable Diffusion 2.1的VAE,几乎没人问这个编解码器适不适合雷达和遥感光学。
潜空间训练里,光学重建天花板就是解码端点:编码器把目标光学压进去再解出来,能有多真,生成器最高就摸到那里。雷达重建则决定条件里还剩多少结构。两个数都该先量。另外,常见做法把SAR和带噪光学在输入处通道拼接,统计差异大、配对还有局部错位时,会过早缠在一起。
ReFlowSET三步。先对SD2.1、SDXL、SD3.0/3.5、FLUX.1/2的冻结VAE做SAR和EO往返重建审计,数据含QXS-SAROPT、SAR2Opt、SpaceNet6、SAR-1M,只用训练划分。FLUX.2在八组数据集-模态里六组PSNR最高,平均光学重建天花板比SD2.1高7.49dB。只留下FLUX.2的编解码器,不继承它那套数十亿参数生成器。
再在该潜空间从零训一个条件DiT,509.3M、24块,条件流匹配:从高斯噪声线性走到光学潜变量,预测速度场。前8块SAR和带噪光学分流通,通道拼接后再走16块联合细化,避免一进门就位置对齐拼接。训练时用冻结DINOv3 ViT-L/16抽干净光学表征,把第8块边界上的带噪光学特征投影过去做余弦对齐,λ=0.5,推理丢掉,不增加延迟。从噪声而不是从SAR潜变量起步,避免速度目标变成输入的解析函数。
QXS-SAROPT 16001/3999,256像素;SAR2Opt 1450/627,512裁剪。两张RTX 4090,CFG 1.5,Euler 50 NFE。所有基线用官方代码在同一划分上重训。
观感和分布指标是主战场,像素对齐指标不是。
| 方法 | QXS FID | QXS DISTS | SAR2Opt FID | SAR2Opt DISTS |
| SD2.1 fine-tune | 19.1 | 0.257 | 71.8 | 0.211 |
| C-DiffSET | 19.9 | 0.233 | 78.1 | 0.214 |
| ReFlowSET (SD2.1 codec) | 25.5 | 0.267 | 84.5 | 0.217 |
| ReFlowSET (FLUX.2) | 19.1 | 0.231 | 66.3 | 0.185 |
QXS上FID追平SD2.1微调,DISTS最好;SAR2Opt上FID相对第二名71.8降7.7%,DISTS相对0.211降12.3%,LPIPS也最好。PSNR/SSIM没拿第一,论文认为配对本身有错位和物理歧义,像素指标会惩罚合理但不对齐的翻译。同框架只换codec,五项指标两套数据全涨,FID从25.5到19.1、84.5到66.3,支撑「先选编码器」不是空话。生成器从零训,没有SD UNet的预训练权重。
12块小模型消融:双流加通道融合相对共享流输入拼接,FID 72.865到70.436,参数108M到145M;token融合几乎不加分,显存和延迟明显更高。加上表征对齐FID 71.851到70.436,推理参数和时延不变。
给潜空间跨模态翻译一个该做却常被跳过的步骤:先量编解码器的往返天花板,再决定在谁的潜空间里训生成器。FLUX.2编码器加小DiT,可以打过带着SD预训练UNet的方法。双流延迟融合对雷达-光学这种物理上不对齐的配对更合理。训练期VFM对齐是免费的推理改进。代码和权重公开。
这是渐进的任务向改进,不是新的生成范式。谁已经在SD潜空间做遥感翻译,优先复现那张重建审计表。
SAR到光学映射物理上就是多对多,模型可以画出雷达里并不支撑的光学结构,作者把「压住无依据的光学外观」列为后续。只报了两个配对基准,跨传感器泛化没测。PSNR/SSIM落后,若下游要的是像素级配准而不是观感,这篇的排序会反过来。消融是12块模型,正式模型是24块,1:2拓扑外推靠的是结构类比。NFE=50,相对一步蒸馏的E3Diff更慢,论文没把头对头比延迟。FLUX.2编码器本身仍是自然图像预训练,雷达域只是选了重建更好的那一个,没有为SAR重训VAE。