Evaluation-Verification Reward for Consistent Multi-Reference Image Editing
Yingmao Miao, Pengfei Zhang, Xiaochen Lv, Meng Yu, Lei Sun, Xiangxiang Chu, Chao Shen, Chenhao Lin
cs.CV
2026-07-31
EVR 把图像编辑评分拆成「先想后验」,验证器逐条找视觉证据去幻觉;人类偏好一致性 0.707,微调 Qwen 后对基线胜率 67%。
多参考图编辑(multi-reference editing)是这么个任务:给一张前景物体参考图、一张背景场景参考图、一条指令,比如「把这个沙发放进这个客厅」,模型要把物体和谐地融进场景,既保住物体的外观一致性,又让整张图看起来协调。现在的扩散模型在这件事上仍然不行,物体容易变形、和场景打架。
用强化学习微调是个常见思路,在文生图和单图编辑上效果很好。但搬到多参考编辑卡在了奖励模型上:现成的奖励模型都是单图数据训的,不会判「多张图之间的约束关系」。直接拿多模态大模型(MLLM)当零样本裁判也走不通。这里有个两难:让它写长思维链(CoT),模型会顺着自个儿生成的文本越走越远,产生幻觉;不让它推理,又拿不出跨多张图做对照所需的逻辑。
EVR(Evaluation-Verification Reward)的核心是把「推理」和「视觉落地」拆成两个阶段,不让同一个模型一次性又想又判。
评估分五个维度:参考一致性(物体外观是否忠于参考)、场景一致性(背景是否连贯)、和谐度(物体融进场景自不自然)、指令一致性(改没改对)、视觉质量(有没有瑕疵)。每个维度,一个 MLLM Evaluator 生成 K=5 条互相独立的假设,每条是一段理由加一个 1 到 5 的打分。然后一个 Verifier 上场,对每条假设去原图里找具体视觉证据,能落实的才接受,落实不了的拒绝,给出可靠性标记。
为什么这么拆?论文的判断是:判「某条具体说法成不成立」比「做一个开放式评估」简单得多,也更容易锚到画面上。多生成几条假设,是为了即便其中几条带幻觉,有效的洞见仍能被捕捉到;验证这一步再把幻觉过滤掉,奖励信号就稳了。
五个维度各自算一个加权分(被接受的假设打分按可靠性加权),最后用几何平均合成总奖励。用几何平均不是凑数:任何一个维度崩了,几何平均会把它狠狠压下去,防止模型为了刷高某个维度而作弊(reward hacking)。整套奖励接进 DiffusionNFT 加 LoRA(rank 64),微调现成的 Qwen-Image-Edit,不改模型结构。
数据是另起的一条流水线:用 GPT 生成物体描述、Z-Image 出图,再条件化生成场景参考图,最后生成替换或插入指令,凑出 1 万组三元组(N=2,即一个物体参考加一个场景参考)。
拿 EVR 做强化学习微调后,Qwen-Image-Edit 在一致性和和谐度上明显涨。
| 维度 | 基线 Qwen-2509 | EVR 微调后 |
| 参考一致性 | 3.35 | 4.43 |
| 和谐度 | 2.22 | 2.73 |
| 指令一致性 | 3.27 | 4.01 |
| 总分 | 0.56 | 0.70 |
对更新的 Qwen-2511 基线,总分从 0.59 提到 0.70,参考一致性 3.66 升到 4.37。
更关键的是这套奖励本身靠不靠谱。EVR 与人类偏好的一致性达到 0.707,显著高于几种常见做法:联合 CoT 0.473、解耦直评 0.578、解耦 CoT 0.629、CoT 平均 0.659、logit 加权 0.643。也就是说,「先想后验」比任何一种单阶段评估都更接近人。
用户研究里,微调后的模型对基线 Qwen-2511 胜率 67%,对 Flux2 是 57.2%,对 Gemini 58.0%,基本追平或超过 NanoBanana 这类专门系统。训练成本可控:4 张 H20,约 150 GPU 小时。
多参考编辑是图像生成走向「可用」的关键一步,纯靠提示词和架构改动已经很难再往前。这篇证明了一件事:瓶颈不在 RL 算法,在奖励信号;只要把多模态模型的「推理」和「落图」分开、再用验证去幻觉,现成编辑模型不改结构就能大幅提升一致性。这个「Evaluator 加 Verifier」的范式不限于图像编辑,任何需要多模态模型做细粒度评判又怕幻觉的场景都可能借鉴。
对做扩散模型 RL 的人,它给了一个比 CLIP 打分、比单图奖励都更贴合多参考任务的奖励构造法。
论文自己点明:N 大于等于 5(五个以上参考)时底座模型本身会出现严重退化,特征纠缠、去噪不全,EVR 能保语义一致却救不了底层图像质量,这套方法的天花板被底座卡死。评测维度和 1 到 5 的打分仍依赖 MLLM 主观判断,人类一致性 0.707 虽高于基线,离完美还远。1 万组训练数据全靠 GPT 加 Z-Image 合成,分布可能偏窄,真实世界复杂编辑任务上泛化如何没验证。作者来自商汤和西安交大,基座 Qwen-Image-Edit 和对比系统 NanoBanana 都是外部模型,利益相关较轻,但「追平 NanoBanana」是在自选测试集上的结论。