PixRestore: Unified Image Restoration via Pixel Diffusion Transformer
Lingchen Sun, Rongyuan Wu, Xiangtao Kong, Jixin Zhao, Qiaosi Yi, Yujing Sun, Shuaizheng Liu, Zhengqiang Zhang, Lei Zhang
cs.CV
2026-08-18
港理工 PixRestore 不用 VAE 和 T2I 预训练,在 patch 化像素上做 flow matching 加 DINO 层自适应引导,50M 参数单步推理全面超过十亿级修复模型。
统一图像修复(UIR)要让一个模型处理噪点、模糊、雨、雾、低光、超分等一大类退化。近两年的主流是拿 SDXL、FLUX 这类文生图潜在扩散模型微调:生成先验强,感知质量好,但带三笔隐性成本。VAE 把图像压进潜在空间,修复最想保的小结构和纹理恰恰在这一步被丢;文生图的开放合成先验会编出看着合理、与输入不符的细节;十亿级底座加 MLLM 规划器再加迭代采样,推理账单吓人,FLUX 系一次修复要 5.8 秒。
香港理工大学与 OPPO 的团队反过来想:UIR 的输入是低质量图,视觉线索是密集给的,真正需要的不是开放生成能力,是对退化的鲁棒和像素级忠实重建。那就不必背文生图这个包袱。
PixRestore 是像素空间的 Diffusion Transformer,不用 VAE、不做 T2I 预训练,backbone 从头训。三个核心机制。
patch 化像素上的 flow matching。低质量图和噪声状态按通道拼接、切成 patch 当 token,DiT 直接在 RGB 像素上学速度场。相对较大的 patch(默认 8)让无 VAE 的长序列可控。论文先用对照实验立住这个选择:同一个 DiT-S,像素版 PSNR 26.62,接三种主流 VAE 的潜在版最高 22.80,参数还更多、要多付 4178ms 的 VAE 编解码。
DINO 层可靠性路由。用冻结的 DINOv2 从低质量图抽多层特征,作者先测了一个事实:不同层对不同退化的可靠性完全不同,浅层对雨、模糊、雪敏感,深层对噪点敏感,中间层对低光、超分、雾敏感,没有一层通吃。于是训一个轻量预测器,从低质量输入猜每层权重(训练时用低质量-高清特征相似度当监督,推理时不需要高清图)。可靠的层加权融合成稠密条件,经交叉注意力注进每个 DiT 块;不可靠的层反而加重高清特征监督,逼模型把这些层的退化洗掉。
单步化。多步模型训好后固定 t=1,从纯高斯噪声一步直达输出,再用一个作用在冻结 DINO 特征上的多层判别器做对抗微调,补回一步生成损失的纹理。
训练语料 283 万张图覆盖八种退化,在 8 张 A800 上先训 25 万步多步版,再 10 万步微调成单步版。
15 个公开基准、八种退化的总平均,两个版本几乎全指标第一第二。代表性数字(PSNR/DR-Score,DR-Score 是他们提出的退化去除得分):
| 方法 | 参数量 | 去雨纹 PSNR | 去噪 PSNR | 平均延迟 |
| FAPE-IR(FLUX 系,重训) | 21575M | 31.91 | 34.22 | 1011ms |
| FoundIR-v2(SDXL 系,重训) | 16910M | 27.85 | 28.17 | 18293ms |
| PixRestore-S | 53.7M | 32.28 | 34.87 | 44ms |
| PixRestore-B | 210.9M | 32.85 | 34.62 | 79ms |
真实世界无参考测试集上,平均 DR-Score PixRestore-B 67.88 第一,重训的 FAPE-IR 67.55 第二。
消融链干净:纯像素 DiT 平均 PSNR 26.62,加单层 DINO 条件到 27.36,六层自适应加层级监督到 27.66,单步化微调后 28.49。同预算下换成纯回归训练只有 27.00,说明涨点来自 flow 预训练而不是损失函数。缩小 patch 或加大 backbone 都继续涨点,GFLOPs 与 LPIPS 相关性 -0.96,设计可扩展。
这篇动摇的是「修图也得背文生图底座」这个近两年的默认假设。修复任务要的是像素忠实,不是开放生成,VAE 这道有损压缩对它是纯负担。54M 对 21.6B,是两个数量级的参数差;44ms 对 5.8s,是两个数量级的速度差,端侧实时修复从不可行变成可行。DINO 层可靠性路由这个部件也不限于修复:任何输入带退变的稠密预测任务都可能借用。方法学上论文还顺手给了个测量学贡献:MUSIQ 这类无参考质量指标会偏好保留雨丝的输出,他们提的 VLM 评判 DR-Score 与人类判断对齐更好。
作者自述:固定 tokenization 使模型绑死训练分辨率,换分辨率要重训或改结构;极端信息缺失的退化(重度雾、极暗)下,紧凑 backbone 撑不住,还是大模型的生成先验占优;DR-Score 依赖专有 VLM(Gemini-3.1 Pro),模型更新可能漂移,每张图要评 5 次也贵。
读下来还要补两条。重训基线用的是他们的 283 万语料,官方权重的 FAPE-IR 在多项上其实也不弱,「全面碾压」要打折听;DR-Score 是自提指标且最优结果都出自自家方法,虽有与人类判断对齐的验证,独立复核还缺。超分任务上 PixRestore 27.01 并不领先 PromptIR 重训版 27.59,信息缺失最重的退化恰好是最弱项,与作者自述一致。