vivo等提出ART妆容迁移,用真实图像监督突破伪目标天花板
机器之心 · wechat · 2026-09-05
ECCV 2026 论文《Anchoring on Reality》(ART)由 vivo 蓝图实验室联合哈工大、南大完成,针对复杂妆容迁移(亮片、脸绘、贴纸)普遍失效的问题。
核心问题:配对数据物理上不存在,行业主流用大模型生成伪目标做监督,但学生的能力被锁死在伪目标质量——「伪目标天花板」。
方法:两阶段训练。Stage I 用伪目标初始化迁移能力并训练辅助卸妆模型;Stage II 将迁移输出保留为可微分「妆容载体」,叠加到参考图素颜版本上重建真实参考图,重建误差作为监督信号反向传播,使监督直接来自真实图像。噪声强度 0.6 为最优。
MF2K 数据集:首个 2K 分辨率真实场景妆容数据集,8,573 张 2048×2048 人像,覆盖素颜/淡妆/浓妆/艺术妆四类。
实验:ART 的 MSimG 在四个测试集全部第一,MF2K 艺术妆上 9.22 对最强基线 8.43;864 次用户盲评三维度均第一。直接验证显示输出质量超过训练伪目标,且换弱生成器(StableMakeup)后仍能大幅超越起点。
启示:配对数据稀缺是现实图像编辑的共性瓶颈,ART 给出「合成数据起步、真实数据监督」的可迁移路径,并首发支持 2048×2048 输出。局限是未显式建模光照与材质。
「多模态」频道最新
- 用 Minimax H3 玩转图片+音频生成视频,实测 Sol-attn — Organic-Thought8662 · 2026-09-06
- MiniMax H3 电影感剪辑实测:「Coffee」视频效果展示 — Jeffu · 2026-09-06
- 博主用 GPT 6 Astra 2 小时做出 3D 钢琴手,琴指真的跟着音符弹 — nptacek · 2026-09-06
- Midjourney 8.2 两个新 sref 风格码,附完整出图参数 — michaelrabone · 2026-09-06
- 40 次实测摸清 Trellis.2 双简化器:Cumesh+Meshlib 串联才是最优解 — Tamerygo · 2026-09-06
- 北大与快手 Kling 推出 MAVIN,多镜头音视频生成入 ECCV 2026 Oral — jiqizhixin · 2026-09-06