Unlocking the Potential of Image Editing via Concept Scaling and Dense Supervision
Long Cui, Xiaoqian Liu, Qi Qin, Yi Xin, Tao Lin, Jianguo Li, Linfeng Zhang
cs.CV
2026-08-18
交大和蚂蚁按一千类编辑概念做成1200万对数据,并把互不重叠的局部编辑叠进同一对图。5M上ImgEdit整体3.75,比ScaleEdit高0.44。
指令编辑现在多半套文生图那套训练:源图加一句指令,预测编辑后的图。两条错位被这篇点出来。第一,数据扩容一直在扩源图花样,编辑概念仍停在十来个粗类,像「改动作」「改风格」。第二,编辑本来就是稀疏监督:真正被改的往往是一小块像素,其余大部分在学恒等映射,等于每个样本里有效梯度很稀。
上海交通大学和蚂蚁用分类树把编辑概念拆到一千类以上,叶子细到「比心」「耸肩」「焦虑表情」。他们还测过 VLM 随机写指令会塌:风格迁移里前五个风格占了 74.6%,其余几十个各不到 1%。瓶颈更像是编辑概念的覆盖,不是源图还不够杂。
合成管线先用大模型从种子分类树向外长,人再清语义重叠和缺项,得到 1028 个叶子概念。对每张源图,VLM 从概念库里挑兼容项、写指令,并同时写出针对这一例的 VQA 检查清单。图像用编辑模型合成,再用这些实例级问题做过滤,而不是套通用模板。随机探索仍保留一小部分,避免分类树把长尾锁死。
稠密监督走组合:VLM 选出空间上互不重叠的多个局部编辑,合成一对图、一条联合指令。一次前向里有多处在学「怎么改」,背景重建占比下降。训练时 ConceptEdit-1000 和组合样本 1:1 混用。实验底座是 Z-Image,指令和过滤用 Qwen3.5-122B-A10B,合成用 FLUX.2-klein-9B,在 2M 和 5M 两个规模上跟 UnicEdit、ScaleEdit 对照。
ImgEdit 上,完整设定(1000 类加组合)2M 整体分 3.48、5M 到 3.75,分别比当时最强的 ScaleEdit 高 0.31 和 0.44。概念粒度自己就有台阶:2M 时 10 类 3.05、500 类 3.26、1000 类 3.33。组合编辑再加 0.15,而且不只涨 Compose 这一栏,5M 上调整、替换、动作也分别加 0.20、0.26、0.25。论文给出的样本效率对照是:不加组合,大约要 1.5 倍样本才能追上带组合的曲线。
| 设定(5M) | ImgEdit 整体 | GEdit-EN GO | GEdit-CN GO |
| ScaleEdit | 3.31 | 5.77 | 5.63 |
| ConceptEdit-1000 | 3.60 | 6.40 | 6.36 |
| 1000 类 + 组合 | 3.75 | 6.62 | 6.60 |
GEdit 上提升主要来自指令跟随 GSC,5M 英文从 ScaleEdit 的 5.77 整体分收到 6.62。实例级 VQA 相对通用校验:精确率 84% 对 75%,召回 87% 对 57%,F1 86% 对 65%。附录里的 ConceptEdit-Bench 用一千个细类测现成模型,闭源 Nano Banana 2 总分 66.19,开源 FireRed-Image-Edit-1.0 为 65.86;人像和构图普遍掉得最狠。
Remove 这一栏并没有全面赢过 ScaleEdit,2M 时还低 0.41。概念扩容不是每一类都涨。
做开源指令编辑的人,这篇把「再堆一千万对」拆成两件可操作的事:概念分布要可控,单对里的有效监督要变密。库驱动能挡住 VLM 写指令时的塌缩;组合编辑则是把稀疏编辑当成压缩问题,而不是再开一个「多概念编辑」任务。对训练预算紧的团队,1.5 倍样本效率比再扩一轮源图更直接。
ConceptEdit-Bench 的用法也清楚:总分接近时,去看人像微表情和空间构图,那些才是现有模型普遍过不去的细类。主实验自己的模型没有放到这个细粒度榜上,细类诊断目前主要服务于别人的模型。
训练只跑在 Z-Image 上,换扩散底座或统一多模态模型是否还成立,没有对照。5M 的 UnicEdit 基线用了重复样本,因为它公开的数据不够,对照并不完全干净。合成上限绑在 FLUX.2-klein-9B 和过滤用的 Qwen 上,分类树再细也滤不掉合成模型系统性做不好的编辑。分类树故意保留跨类语义重叠,「霓虹」会同时出现在风格、环境和打光里,诊断粒度可能被重复概念稀释。主实验停在 5M,12M 全量有没有额外收益没报。数据集和代码写的是发表前后公开,本稿还看不到真实样本。