Anchoring on Reality: Breaking the Pseudo-Target Ceiling in Makeup Transfer
Bo Wei, Xianhui Lin, Yi Dong, Zhongzhong Li, Zonghui Li, Zirui Wang, Jiachen Yang, Xing Liu, Hong Gu, Xiaoming Li, Wangmeng Zuo
ECCV 2026
cs.CV
2026-06-30
哈工大、vivo与南大用两阶段DiT做妆容迁移:先模仿伪目标站稳布局,再在潜空间重建真实参考图来罚漏细节。自建8573张2K数据集上,妆容相似度9.22,压过GPT Image 1.5的8.43。
妆容迁移要把参考图的化妆品画到源人脸上,身份和几何不动。困难在于没有成对真值:同一个人、同一姿势、只差妆,几乎拍不到。早期方法靠 CycleGAN 式弱先验,复杂贴纸和脸绘对不齐。后来用大编辑模型合成伪目标再回归,全局像样了,模型也把伪目标的毛病学死:身份漂、细节糊、背景被顺手改掉。论文把这层上界叫伪目标天花板:只模仿合成图,就不可能超过合成图。
哈工大、vivo BlueImage Lab 与南京大学的做法是:伪目标只负责站稳位置,细纹理改去锚定真实参考图本身。
骨干是 FLUX.1-Kontext-dev,LoRA rank 32,Flow Matching 训练。条件用 token 拼接:噪声目标、源、参考。数据侧发布 MakeupFaces2K(MF2K):8,573 张 2048×2048 野外肖像,裸妆 3,139、淡妆 2,063、浓妆 1,798、艺术妆 1,573,男性肖像补得比旧集多。分层抽 2,000 组源-参考,用大编辑模型生成伪目标组成训练三元组。
Stage I 两件事并行。迁移模型回归伪目标,学会语义对齐和全局落妆。辅助卸妆器 R 用(伪目标,源)对做一步去噪,外加 LPIPS、ArcFace 身份、关键点几何,训完冻住,用来从参考图抽出裸脸 Ibareref。
Stage II 把监督从伪目标挪到真参考。在噪声水平 σtr 对伪目标潜变量加噪,一步 Euler 预测可微的妆容载体 ẑ,不解码成像素。同一套权重的 DiT 再用裸脸潜变量加 ẑ 去重建真实参考潜变量。重建梯度顺着 ẑ 流回第一次迁移预测,漏了闪粉、贴纸、眼线,重建就会变差。只用重建会塌成「不管源脸、把参考抄回去」,所以加一项 bottleneck:只在 σtr 这一层把速度场拉向伪目标,保住粗布局。默认 σtr=0.6,λrefine=1,λbot=0.2。两阶段各 10k step,4 张 H20。
和 CycleGAN 的差别在循环重建的是参考图,不是源图。罚的是妆有没有被带走,不是域能不能可逆。
四个测试集各 100 对,身份不重叠;MF2K 测试参考只从艺术妆里抽。妆容相似度用 Gemini 3 Pro(MSimG)和 Qwen2.5-VL-72B(MSimQ)打 0–10 分,图统一缩到 512。身份用 ArcFace 余弦,背景用未编辑区域的 L2-M。
MSimG 四套全第一,艺术妆 MF2K 上 9.22,对 GPT Image 1.5 的 8.43、Nano Banana Pro 的 8.34、StableMakeup 的 6.73。身份在 MT 上最高 0.87;MF2K 上 0.74,低于 SHMT 的 0.82,但 SHMT 的 MSimG 只有 3.47。GPT Image 1.5 身份掉到 0.35,几何不保。L2-M 四套全最低,MF2K 4.31,对 GPT 的 28.32、Banana 的 13.27,背景乱改被压住。FID 高于 StableMakeup:FID 看的是平均脸分布,把艺术妆的高频纹理抄真了,反而像出域。
21 人 864 次评分,1–5 分。ART 妆容 3.67、身份 4.03、画质 3.83;Banana Pro 是 3.43 / 3.12 / 3.81,GPT Image 1.5 是 3.31 / 2.15 / 3.82。人眼里身份优势比自动指标更大。
消融对得上故事。只跑 Stage I,MF2K 的 MSimG 8.82、身份 0.57,还在仿伪目标。只跑 Stage II,身份 0.70 但载体没有布局,MSimG 8.08。两段合在一起才是 9.22 / 0.74,L2-M 4.31。换用更弱的 StableMakeup 伪目标,ART 仍把 MF2K 的 MSimG 做到 8.56,而把 StableMakeup 拿去 MF2K 上重训,复杂妆还更差(6.58)。天花板是监督方式,不完全是伪目标生成器有多强。σtr 小则保守、妆弱,大则身份和背景垮,0.6 是折中。文中给到 2K 输出,并加小波损失盯高频,声称是首个高保真 2K 妆容迁移。
谁若在产品里用大编辑模型做「换妆」,会把编辑器的身份漂和背景改写一起上线。ART 把大模型降级成初始化器,用可微循环把细节钉回真实参考,这是对伪标签训练的一次具体修补,不只是再刷一个妆容 SOTA。MF2K 补了分辨率和艺术妆、男性样本,后续工作有公共难点可打。代价是训练仍要一台能出伪目标的编辑模型,卸妆器也要先训好。渐进,但是打在真瓶颈上。
作者承认没有显式约束光照和反射。参考图是硬侧光高光、源图是柔光时,高光会被一起搬过去,物理上不成立。妆容分数来自 VLM,图还缩到 512,2K 的细贴纸优势可能被裁判分辨率吃掉;他们自己也弃用 CLIP/DINO 当妆容指标,说明自动度量不稳。FID 与观感打架,表上这项并不占优。测试每集 100 对,艺术妆子集更窄。卸妆器在伪目标上训,卸真妆的偏差会漏进循环。跨性别、遮挡在定性图里好看,没有单独的定量分层。ECCV 2026 论文,代码页给出项目站点,复现成本取决于能否调用同等编辑模型来造伪目标。