不用你下指令,vivo SmartPhotoCrafter先推理照片缺陷再自动修图

SmartPhotoCrafter: Unified Reasoning, Generation and Optimization for Automatic Photographic Image Editing

Ying Zeng, Miaosen Luo, Guangyuan Li, Yang Yang, Ruiyang Fan, Linxiao Shi, Qirui Yang, Jian Zhang, Chengcheng Liu, Siming Zheng, Jinwei Chen, Bo Li, Peng-Tao Jiang

cs.CV

2026-04-21

现有修图模型得你告诉它改什么。SmartPhotoCrafter用一个Image Critic先推理照片缺陷(雾、曝光、饱和度)并给修改建议,再让Photographic Artist据此修图,经三阶段训练(预训练、推理适配、协同RL),在自动修图和多编辑指令遵循上超过一众生成式基线。

这篇在解决什么

传统修图默认你会下指令:你得知道哪里不好、该怎么改,才能让模型照做。但非专业用户往往说不出最优的修图指令,而且现有「指令条件」的编辑模型本身没有感知图像质量、判断缺陷的能力,做不了全自动增强。这篇要解决的就是:让模型自己看出这张照片哪里不行,再自己修。

方法

SmartPhotoCrafter 把图像编辑当成一个推理到生成的紧耦合过程,两个模块。

三阶段训练:Stage I 基础预训练,在图像质量评估(IQA)和编辑数据上分别 SFT;Stage II 推理条件适配,Artist 以 Critic 的隐式表征为条件;Stage III 协同推理到生成 RL,两个模块在统一 RL 框架里联合训练。奖励设计里有个 Photometric Control Reward(rphoto),专门盯属性级的光度(色调、色彩)敏感度,防止 RL 过拟合到高层审美而漂移。整个流程强调照片级真实生成,同时支持修复(restoration)和润色(retouching),并对色彩、色调语义保持一致。

数据上自建分阶段数据集:Critic 用 KonIQ-10K、SPAQ、KADID-10K 等 IQA 数据加多种失真数据(去模糊、去雾、低光、去阴影);润色用 FilmSet 合成色彩分级、RealBokeh、BokehDiff 做景深。

结果

对比 Instruct-Pix2Pix、FLUX2.Dev、Qwen-Image-Edit、OmniGen2、Step1X-Edit(参考 GT 的 MUSIQ 70.96、NIMA 5.23)。

方法MUSIQFIDLPIPSDINOCLIP
FLUX2.Dev72.9476.260.260.930.88
Qwen-Image-Edit68.6342.810.170.960.93
本方法69.5227.960.100.980.96

感知质量(MUSIQ)排第二,输给 FLUX2,但 FLUX2 偏 AI 风格、FID 高、偏离照片分布;本方法在分布一致性(FID、LPIPS 最低)和语义对齐(DINO、CLIP 最高)上最好,更平衡。多编辑指令遵循上六个指标全取第一(PSNR 21.05、SSIM 0.82、LPIPS 0.09)。在去模糊、去雾两个经典修复任务上也多数最优。

消融验证了 rphoto 的作用:加 RL 但不要 rphoto,MUSIQ 小涨但 FID 反而从 30.61 恶化到 38.51(分布漂移);加上 rphoto 后 FID 回落到 27.96,NIMA、DINO、CLIP 都到最高。

为什么重要

「不用下指令、模型自己判断并修图」是计算摄影里一个实在的痛点,尤其对手机普通用户。这篇把多模态推理和生成真正接到了表征级(不是只把 Critic 的文本喂给生成器),并且用一个光度奖励管住了 RL 容易出现的「过度增强、漂成 AI 风」。对做图像编辑、审美增强产品的人,这套诊断加修改的耦合思路和奖励设计值得参考。

局限与存疑

论文没有专门的局限性章节,几处存疑值得说。一是评测全靠代理指标(MUSIQ、NIMA、PSNR、FID、LPIPS、CLIP、DINO),没有人工偏好评测,而修图本质是主观的、存在多种合理输出,代理指标和真人偏好的对齐没验证。二是它强于保真和分布一致,代价是 MUSIQ 这种感知质量分数并不最高,对想要强风格化、大幅改图的场景未必合适。三是 base 模型架构、与最强闭源编辑模型的对比都没给,只在开源生成式基线里比;自动增强的测试集里还混了合成退化(如 AVA 上随机加退化),泛化到真实手机出片的脏数据程度未知。

术语

原文与代码

社区讨论

相关论文

全部论文解读