隔玻璃拍的视频怎么去反光:扩散模型单步去噪,比传统方法快 1.67 倍

From Synthesis to Removal: Physics-Grounded Reflection Simulation and Diffusion-Based Video Dereflection

Zepeng Wang, Jiagao Hu, Fuhao Li, Yuxuan Chen, Fei Wang, Daiguo Zhou

cs.CV, cs.AI, eess.IV

2026-08-12

小米团队提出 S2R 闭环框架,用物理合成配对数据+扩散去反光模型+基准,在视频去反光上拿到最优质量和速度,S2R-Ref 上 PSNR 28.84、每帧 87ms。

这篇在解决什么

隔着玻璃拍视频(橱窗、车窗、博物馆展柜),画面里总会叠一层反光,既难看又干扰下游视觉任务。单图去反光研究得很透,视频去反光却几乎是空白:缺成对的训练数据(同一个场景的有反光和无反光视频)、缺能保持时间连贯的模型、也没有专门的评测基准。

这篇用一个闭环框架同时填这三个坑:先合成带反光的成对视频数据,再训一个基于扩散模型的去反光网络,最后搭一个基准来评。

方法

合成管线叫 S2R-Synthesis,核心是在结构空间(lineart 条件)里做物理增强,再用一个训好的视频扩散渲染器把反光视频画出来。增强模块 PGA 把三种玻璃物理效应建模进去:粗糙度导致的模糊(高斯卷积,σ∈[5,15])、玻璃厚度导致的鬼影(加一个偏移副本,偏移 Δ∈[-50,50] 像素)、反射率变化(Fresnel 分解下的仿射调制)。

去反光模型叫 S2R-Removal,基于 Wan2.1-Fun-1.3B-Inp,走视频修复范式。两阶段:第一阶段做 reflection-aware 的潜空间适配(LoRA 微调,同时学扩散损失和反射强度);第二阶段做单步像素-几何精修,只跑一次去噪,加像素重建、SSIM 和深度一致性损失(用冻结的 LeReS 估深度,只算反光区域的误差)。单步去噪是它能在速度上甩开别人的关键。

基准 S2R-Bench 分两半:S2R-Ref(60 对带全参考指标的视频)、S2R-Real(50 条真实反光视频,做人感评分)。

结果

在 S2R-Bench 和多个公开图像基准上都拿到最优,而且比次优方法快。

方法S2R-Ref PSNRTC平均 PSNR速度(ms/帧)
GenSIRR27.040.964828.037214.94
DAI27.35217.27
RDNet24.710.956426.63145.13
S2R(本篇)28.840.974028.7787.09

S2R-Ref 上 PSNR 28.84、时间一致性 0.9740,都是最高;真实视频的人感评分(去除 0.787、保留 0.980)也领先。推理 87.09 ms/帧,比次优的 RDNet(145ms)快约 1.67 倍。注意 GenSIRR 这种生成式方法精度接近但慢了 80 倍。

合成数据本身也有效:在 OpenRR-1k 上,用本篇合成数据训练的 RDNet 比只用基础数据训练高了 +4.31 PSNR。

为什么重要

对做视频增强、自动驾驶感知、安防这类会被玻璃反光干扰的场景,这是目前质量和速度都靠前的选择,而且是扩散模型里少见的又快又准。它的合成管线还能当数据增强工具单独用,如果手上的去反光模型缺训练数据,可以用 S2R-Synthesis 造一批成对样本喂进去。

局限与存疑

作者承认两点:反光被建模成单层,多层玻璃界面叠出来的复杂反光处理不了;当相机运动和反光运动强相关或视差主导时,性能会下降,因为模型假设两者相对独立。

此外评测的 PSNR、SSIM 主要在合成对上,真实场景的去没去干净最终靠人感评分 50 条样本,统计意义有限。

术语

原文与代码

相关论文

全部论文解读