无训练 RefineEdit 用比特概率差定位编辑,九类任务背景 PSNR 30.25

Refinement Is Inherently Editable: Training-Free Prompt-to-Prompt Image Editing with Generative Refinement Network

Yulong Chen, Ziqian Zhang, Haoyu Zhang, Ao He, Senmao Li, Kai Wang

cs.CV

2026-09-18

港城大东莞与 MBZUAI 提出 RefineEdit:冻结 GRN,用源与编辑两支对同一比特的概率差选出可改位置,其余抄源轨迹。PIE-Bench 九类上背景 PSNR 30.25,高于 FlowEdit 的 25.03。

这篇在解决什么

文本引导的图像编辑要同时做成两件事:按编辑提示改该改的地方,把无关区域原样留下。扩散模型这一路的免训练编辑,大多靠 mask、attention map 或中间特征注入来划定可改区域。区域划窄了,改不完整;划宽了,背景跟着跑。因果自回归编辑器还有一道硬约束:解码顺序一旦定死,前面的 token 没法回头改。

Generative Refinement Network(GRN,生成式细化网络)走另一条路。它把图像编成 Hierarchical Binary Quantization(HBQ,分层二值量化)码,再对整张码图做全局随机细化:每一步并行预测所有比特,按余弦日程把一部分预测写回去、其余退回最初的随机码。坐标可以改,改完还能再改。港城大东莞、港城大和 MBZUAI 把这个性质直接拿来做编辑,提出免训练框架 RefineEdit。判断很短:细化过程本身就是可编辑的。

方法

源图仍由冻结的预训练 GRN 生成,实验用 GRN-2B,分辨率 1024×1024,空间码网格 64×64,细化 50 步。编辑时先按源提示 cs 走源轨迹。到切换步 ts,把当前源状态复制给编辑支,两支共用同一份随机码 Z 和同一套细化日程,分别在 cs 和编辑提示 ce 下继续。

每一步对比两支对「源支刚采到的那个比特」给出的概率,得到 signed probability drop(带符号概率下降)Δ:源支概率减编辑支概率。Δ 为正,说明编辑提示不再认这个源比特,这个坐标就有离开源的理由。

选位分两层:

选中的比特走编辑支的细化提案;没选中的比特直接抄同一细化步的源状态。这叫 source-anchored routing(源锚定路由)。不需要外接 mask,也不动 attention。

两套稳定器防止 mask 在后续步里乱飘。Adaptive spatial freezing(自适应空间冻结):切换步那一刻,如果已选位置的平均超额响应够强(默认阈值是 2τspatial),空间 mask 就钉死,比特选择仍可动。Finite bit locking(有限比特锁定):最近 K 步(默认 K=4)里只要进过可编辑集合,这一步仍可改;锁的是资格,不是比特取值,值继续被预测和随机细化。K=1 就退回逐步即时选择。

默认 ts=18、τspatial=0.015、τpower=0.12。真正上报的数字是按九类任务分别调的:物体替换 ts=15,物体删除、背景改和风格迁移 ts=10。K 和冻结倍率九类共用。附录写明,这套配置来自 1499 组网格搜索,直接在评测集上选,没有单独的 held-out 划分。

结果

评测用 PIE-Bench 九类,共 560 张:替换、添加、删除各 80,内容、姿态、颜色、材质各 40,背景和风格各 80。源图由 GRN 按源提示生成,所有方法改同一张图。基线输出是 512×512,GRN 源图和 RefineEdit 结果先缩到 512 再比。前景 mask 用 Grounded-SAM,只用于区域指标,不进 RefineEdit 自己的动态 mask。

主表数字如下,未编辑区域看保真,CLIP 看语义:

方法骨干Struct Dist↓PSNR↑LPIPS↓SSIM↑CLIP 整图 / 编辑区↑
P2PSD 1.40.057219.020.1490.77124.88 / 22.26
PnP-DirectInvSD 1.50.022923.370.0810.85225.57 / 22.77
LEDits++SD 1.50.041420.590.1000.82026.22 / 23.29
FlowEditFLUX.1-dev0.016225.030.0620.90224.85 / 21.95
RefineEditGRN0.022430.250.0320.95026.47 / 23.30

七项里五项第一。背景 PSNR 比次好的 FlowEdit 高 5.22,SSIM 从 0.902 到 0.950,LPIPS 从 0.062 到 0.032。结构距离 FlowEdit 仍更低,0.0162 对 0.0224。编辑区 CLIP 只比 LEDits++ 高 0.01,论文自己说这是语义对齐相当、保真更好,谈不上语义大赢。

正文里写过 PSNR 30.50、整图 CLIP 26.51,和表 1 的 30.25 / 26.47 对不上。解读按表 1。

单卡 A100、1024 分辨率,RefineEdit 一次编辑 26.77 秒,FlowEdit 27.15 秒,PnP 约 80 秒。20 人、20 组、400 票的盲选里,RefineEdit 拿 60.25% 票,FlowEdit 17.75%,LEDits++ 11.50%,ChordEdit 10.50%。

物体替换子集上,切换步从 15 拖到 20,背景 PSNR 从 26.08 升到 31.14,编辑区 CLIP 从 20.12 掉到 18.57:切得越晚越保背景、越改不动。附录 Table 6 的消融数字论文自己标注是 simulated placeholders,这里不引用。定性上,去掉空间冻结,机器人周围的屋顶会被改掉;去掉比特锁定,手指改不完。

为什么重要

这是第一篇把 GRN 接到免训练 prompt-to-prompt 编辑上的工作。对已经在用 GRN 出图的人,它给出一条不微调、不外接 mask、不改 attention 的改图路径,定位证据就从两支细化轨迹的比特概率里来。

对扩散和 flow 编辑这条主流线,它更像一次骨干换位后的对照,不是同模型上的算法碾压。保真数字漂亮,一部分可能来自 HBQ 码本身可对齐、可逐比特抄源,不一定能平移到 SD 或 FLUX 上。超参还按任务类别手调,离「丢进去就改」还有距离。

局限与存疑

论文自己写了几条硬限制。RefineEdit 必须拿到 GRN 的源轨迹,不能直接吃真实照片。冻结不完整的初始 mask 会把目标区域挡在外面;mask 继续膨胀又会改到无关处。比特锁定只保住编辑资格,不保证语义真改到位。切换步和两个阈值仍要调,九类配置是在评测基准上搜出来的,没验证过未见过的提示分布。

评测协议也有坑。基线是 SD 1.4/1.5、SD-Turbo、FLUX.1-dev,RefineEdit 是 GRN-2B,骨干不同。1024 出图再缩到 512 去跟 512 基线比,PSNR 和 SSIM 可能偏向分辨率更高的一方。超参直接在评测数据上选,表 1 的领先幅度含有过拟合成分。定量消融表还是占位数字。这几条加在一起,保真第一可以信方向,幅度要打折。

术语

原文与代码

相关论文

全部论文解读