Oxygen-TryOn: Fashion-Native Foundation Model for Any-item Virtual Try-On
Yong Liu, Xiaolong Fu, Zihang Xu, Wen Xue, Xueheng Li, Lin Song, Yuan Zhang, Chuyang Zhao, Haoyang Huang, Nan Duan, Yipeng Sun, Yan Li, Simiu Gu
cs.CV
2026-07-24
京东的 Oxygen-TryOn 把虚拟试穿从 mask 涂抹重写成多参考图理解驱动生成,一套流程同时支持任意品类、任意件数搭配,在自建评测和公开 DressCode 上全面超过 GPT-Image-2 与 Seedream5 Lite。
虚拟试穿(virtual try-on)要做的事看起来很简单:给一张商品图和一张人物图,合成出这个人穿上这件商品的照片。但现有系统几乎都卡在同一个地方,只能处理单一品类,而且默认参考图是干干净净的棚拍平铺图。一旦参考图是真人穿在身上的「野生」照片,或者你想一次性把上衣、裤子、鞋、包、帽子搭上去,大多数模型就崩了。
更强的系统(GPT-Image-2、Seedream5 Lite、Nano Banana Pro)闭源,且本质上是通用图像编辑器被硬拉来干试穿;开源这边,FLUX.2 这类模型在试穿上还追不上闭源。Oxygen-TryOn 的出发点是:与其改造通用编辑器,不如从一开始就为试穿造一个原生的基础模型。
核心选择是把试穿的范式换掉。以往做法是基于 mask 的 inpainting(在人物图上圈出要换的区域再补全),Oxygen-TryOn 把它重写成「多参考图、理解驱动的生成任务」:模型先理解每件参考物是什么、该穿在哪、谁挡谁,再生成。
底座是 JoyAI-Image-Edit:Qwen3-VL-8B 负责理解,Wan-2.1 VAE 编码隐空间,一个 16B 参数的多模态扩散 Transformer(MMDiT)负责生成。人物图和参考图通过共享 VAE 编码成 token,排进同一条序列:目标区是高斯噪声逐帧去噪,参考区直接放干净的隐向量做条件。这里有个反直觉的设计,不给参考图加任何 segment 或 index embedding,而是用多模态 RoPE 的时间轴给目标和每张参考分配不重叠的区间,参考物靠自然语言里的「图 1」「图 2」来绑定。模型是靠读指令来对齐参考,不靠专用 token。
训练分三阶段:
数据引擎从 5000 万+原始图像里过滤,覆盖服装、鞋、包、帽、眼镜、首饰,四条配对管线造训练对(真品+真人、真品+合成人、合成品+真人、全合成)。这是它敢叫 fashion-native 的底气。
公开 benchmark 上(DressCode、VITON-HD),Oxygen-TryOn 把配对 FID 拉到 1.93(DressCode),显著低于 FastFit 的 3.66 和 CatVTON 的 5.03;VITON-HD 上同样从 FastFit 的 6.86 降到 3.94。
在 VLM 评测 TStars-VTON(1-10 分)上,单件试穿整体分 Oxygen-TryOn 9.36,超过 Seedream5 Lite 的 8.77 和 GPT-Image-2 的 8.34;多件试穿整体 8.41,领先 GPT-Image-2(7.90)和 Seedream5 Lite(8.19),只有 Item Fidelity 一项略输 Seedream5。
| 评测 | 指标 | Oxygen-TryOn | 对照 |
| DressCode 配对 | FID↓ | 1.93 | FastFit 3.66 |
| VITON-HD 配对 | FID↓ | 3.94 | FastFit 6.86 |
| TStars 单件 | 整体↑ | 9.36 | GPT-Image-2 8.34 |
| TStars 多件 | 整体↑ | 8.41 | Seedream5 Lite 8.19 |
自建的 Oxygen-TryOn Bench(1000 真实样本,GPT-5 评判)和 985 样本的人工评测里,可用率是它最突出的优势:Cloth-to-Model 场景可用率 86.8%,GPT-Image-2 是 80.4%、FLUX.2 只有 67.5%。人工评测整体分 3.55,微弱领先 GPT-Image-2 的 3.54,人物一致性(3.75 vs 3.64)更高,而 GPT-Image-2 在物品一致性和美感两项略胜。
训练配方消融显示,大跃迁发生在 SFT 阶段(可用率从 CPT 的 68% 跳到 86%),RL 主要磨细粒度一致性,提升在 1 个百分点量级。
对电商和内容生成,这意味着虚拟试穿第一次能稳定地处理「一整套搭配」和「真人参考图」这两个过去必须人工兜底的场景,可用率从七成出头拉到八成五以上,直接关系到能不能规模化上线。把试穿从 inpainting 改成理解驱动的多参考生成,也给后续工作一个清晰的范式参照:不靠专用 token,靠指令里的自然语言位置就能绑定多张参考。
需要诚实说,在美感、纹理还原这些维度上,它和最强的闭源系统是互有胜负的领先,不是碾压。
作者自己承认:参考件数到 5 件以上、叠加层次复杂时,多件协调会变难;多件层叠下的物品保真度受限于底座模型本身的能力,某些闭源系统在多件场景的纹理还原上仍更强。
读下来还有两点没说透:一是 RL 阶段的提升只有 1 个百分点量级,相对于三阶段配方的工程复杂度(自研奖励模型 + Gemini 评判 + DiffusionNFT),ROI 是否成立论文没讨论;二是大多数结果来自自建 bench 和自选的 re-evaluated 子集,公开 benchmark 是「re-evaluated subset」,具体子集怎么选的需要读者自行核对。