虚拟试穿重做成多参考图生成,京东 Oxygen-TryOn 指标反超 GPT-Image-2

Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On

Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu

cs.CV

2026-07-24

京东的 Oxygen-TryOn 把虚拟试穿从 mask 涂抹重写成多参考图理解驱动生成,一套流程同时支持任意品类、任意件数搭配,在自建评测和公开 DressCode 上全面超过 GPT-Image-2 与 Seedream5 Lite。

这篇在解决什么

虚拟试穿(virtual try-on)要做的事看起来很简单:给一张商品图和一张人物图,合成出这个人穿上这件商品的照片。但现有系统几乎都卡在同一个地方,只能处理单一品类,而且默认参考图是干干净净的棚拍平铺图。一旦参考图是真人穿在身上的「野生」照片,或者你想一次性把上衣、裤子、鞋、包、帽子搭上去,大多数模型就崩了。

更强的系统(GPT-Image-2、Seedream5 Lite、Nano Banana Pro)闭源,且本质上是通用图像编辑器被硬拉来干试穿;开源这边,FLUX.2 这类模型在试穿上还追不上闭源。Oxygen-TryOn 的出发点是:与其改造通用编辑器,不如从一开始就为试穿造一个原生的基础模型。

方法

核心选择是把试穿的范式换掉。以往做法是基于 mask 的 inpainting(在人物图上圈出要换的区域再补全),Oxygen-TryOn 把它重写成「多参考图、理解驱动的生成任务」:模型先理解每件参考物是什么、该穿在哪、谁挡谁,再生成。

底座是 JoyAI-Image-Edit:Qwen3-VL-8B 负责理解,Wan-2.1 VAE 编码隐空间,一个 16B 参数的多模态扩散 Transformer(MMDiT)负责生成。人物图和参考图通过共享 VAE 编码成 token,排进同一条序列:目标区是高斯噪声逐帧去噪,参考区直接放干净的隐向量做条件。这里有个反直觉的设计,不给参考图加任何 segment 或 index embedding,而是用多模态 RoPE 的时间轴给目标和每张参考分配不重叠的区间,参考物靠自然语言里的「图 1」「图 2」来绑定。模型是靠读指令来对齐参考,不靠专用 token。

训练分三阶段:

数据引擎从 5000 万+原始图像里过滤,覆盖服装、鞋、包、帽、眼镜、首饰,四条配对管线造训练对(真品+真人、真品+合成人、合成品+真人、全合成)。这是它敢叫 fashion-native 的底气。

结果

公开 benchmark 上(DressCode、VITON-HD),Oxygen-TryOn 把配对 FID 拉到 1.93(DressCode),显著低于 FastFit 的 3.66 和 CatVTON 的 5.03;VITON-HD 上同样从 FastFit 的 6.86 降到 3.94。

在 VLM 评测 TStars-VTON(1-10 分)上,单件试穿整体分 Oxygen-TryOn 9.36,超过 Seedream5 Lite 的 8.77 和 GPT-Image-2 的 8.34;多件试穿整体 8.41,领先 GPT-Image-2(7.90)和 Seedream5 Lite(8.19),只有 Item Fidelity 一项略输 Seedream5。

评测指标Oxygen-TryOn对照
DressCode 配对FID↓1.93FastFit 3.66
VITON-HD 配对FID↓3.94FastFit 6.86
TStars 单件整体↑9.36GPT-Image-2 8.34
TStars 多件整体↑8.41Seedream5 Lite 8.19

自建的 Oxygen-TryOn Bench(1000 真实样本,GPT-5 评判)和 985 样本的人工评测里,可用率是它最突出的优势:Cloth-to-Model 场景可用率 86.8%,GPT-Image-2 是 80.4%、FLUX.2 只有 67.5%。人工评测整体分 3.55,微弱领先 GPT-Image-2 的 3.54,人物一致性(3.75 vs 3.64)更高,而 GPT-Image-2 在物品一致性和美感两项略胜。

训练配方消融显示,大跃迁发生在 SFT 阶段(可用率从 CPT 的 68% 跳到 86%),RL 主要磨细粒度一致性,提升在 1 个百分点量级。

为什么重要

对电商和内容生成,这意味着虚拟试穿第一次能稳定地处理「一整套搭配」和「真人参考图」这两个过去必须人工兜底的场景,可用率从七成出头拉到八成五以上,直接关系到能不能规模化上线。把试穿从 inpainting 改成理解驱动的多参考生成,也给后续工作一个清晰的范式参照:不靠专用 token,靠指令里的自然语言位置就能绑定多张参考。

需要诚实说,在美感、纹理还原这些维度上,它和最强的闭源系统是互有胜负的领先,不是碾压。

局限与存疑

作者自己承认:参考件数到 5 件以上、叠加层次复杂时,多件协调会变难;多件层叠下的物品保真度受限于底座模型本身的能力,某些闭源系统在多件场景的纹理还原上仍更强。

读下来还有两点没说透:一是 RL 阶段的提升只有 1 个百分点量级,相对于三阶段配方的工程复杂度(自研奖励模型 + Gemini 评判 + DiffusionNFT),ROI 是否成立论文没讨论;二是大多数结果来自自建 bench 和自选的 re-evaluated 子集,公开 benchmark 是「re-evaluated subset」,具体子集怎么选的需要读者自行核对。

术语

原文与代码

相关论文

全部论文解读