UniSpace: Unified Visual Representation and Scalable Multimodal Modeling
Jinbo Yan, Limeng Qiao, Jie Qin, Junyan He, Feize Wu, Guanglu Wan
cs.CV, cs.AI
2026-08-09
给冻结语义ViT另学一条重建补丁通路,PR-DINOv2的rFID从0.57降到0.14,理解分数几乎不掉;8B UniSpace用同一视觉空间做生成和编辑。
CLIP、SigLIP 这类语义视觉编码器,已经是多模态理解的默认视觉接口,生成和编辑系统也拿它们当语义条件。问题是最后一层 token 为对齐语义而被压成抽象,像素级细节留不住,重建很差。于是现有系统只好两套视觉空间并行:语义 ViT 管理解,VAE latent 管生成。BAGEL 这类统一模型在骨架上把理解和生成放进同一个 MoT,视觉表征仍然是两套。
美团这条线问的是更硬的问题:能不能在预训练语义 ViT 上做出一块同时服务理解、生成和编辑的视觉空间。他们的判断是,冻结的 Transformer 块并不是天生传不了细节,把细节压掉的是原来的补丁嵌入。
诊断实验把 SigLIP2 的预训练补丁嵌入换成随机线性投影,后面所有 Transformer 权重冻住,重建探针保持不变。最后一层 PSNR 从 20.96 升到 24.66,多出 3.70 dB。补丁层出口两侧都还能重建,大约 39.3 和 39.7 dB,分叉发生在同一组冻结块往下走的路上。语义分类准确率随深度从 0.93% 爬到 81.29%,预训练通路上的像素可恢复性同步塌掉。随机投影打乱了这条被优化出来的语义轨迹,残差通路里才留下更多低层变化。随机化本身不能用,语义会被毁掉。它只说明:换输入参数化,同一组冻结块能走另一条路。
Patch Reparameterization 据此加了一条通路。原来的补丁嵌入 Ps 和 Transformer 块全部冻结,保住预训练语义 token Ts。另学一个重建向补丁嵌入 Pr,从 Ps 初始化,过同一组冻结块得到 Tr。Tr 压到 128 维再和 Ts 在通道上拼接,得到统一表征 Tu。PR-SigLIP2 和 PR-DINOv2 是 768+128=896 维,PR-Qwen-ViT 是 1152+128=1280 维。
这里故意不用 MLP 把两路揉成一团。对照实验里,揉在一起的表征在真实编码 latent 上重建很好,rFID 0.069、PSNR 33.83,零样本分类 78.53,对照 SigLIP 的 79.10。拿去训 DiT 之后,高保真重建解码器解出来 FID 120.9,语义解码器却是 8.07。大约 95% 的融合输出方差被语义通路解释掉,生成先验几乎没学会重建需要的方向。显式拼接是为了让 flow matching 能单独盯住重建通道。
重建只更新 Pr、压缩层和 ViT-XL 解码器,语义通路不动。生成用分量平衡的 flow matching,重建通道权重 λr=0.75。UniSpace 把 PR-Qwen-ViT 接到 Qwen3-8B 的 MoT 上,理解和生成专家硬路由,层内共享自注意力。参考图、目标图、生成图都走同一套冻结 tokenizer,没有第二条 VAE。训练分 256、512、1024 三档再加 SFT,大约 5.10 亿次样本、4700 亿多模态 token,在昇腾 910B 上花了约 14.2 万 NPU 小时。
Tokenizer 在 ImageNet-1K 256 验证集上,PR-DINOv2 的 rFID 0.14、PSNR 30.84、SSIM 0.90。对照同骨干的 RAE:rFID 从 0.57 降到 0.14,相对降 75.4%;PSNR 从 18.86 升到 30.84;SSIM 从 0.48 升到 0.90。PR-SigLIP2 的 rFID 从 0.53 降到 0.18。比 RAEv2 用更大的 DINOv3-L、K=7 折中设置(PSNR 22.57、rFID 0.29)也更好,rFID 甚至低于 FLUX-VAE 的 0.18 和 SD-VAE 3 的 0.20。
LLaVA-v1.5、Vicuna-7B、冻结视觉编码器的理解评测里,完整 Tu 送进投影层。PR-SigLIP2 均分 64.37,对照原 SigLIP2-B 的 63.39;PR-Qwen-ViT 68.94,对照 68.29。语义几乎没被重建通路挤掉。
生成是另一头的代价。PR-DINOv2 配 839M DiT,无 CFG 的 gFID 2.10,CFG 1.2 时 1.87;RAE 同规模是 1.51 和 1.13。重建好了,先验更难拟合。
系统级上,8B UniSpace 的 ImgEdit 总分 4.28,BAGEL 7B 是 3.20,20B 的 Qwen-Image-Edit-2511 是 4.51。弱项是 Hybrid,只有 2.70。GEdit 英文 7.41、中文 7.38,双语均分 7.39,高于 BAGEL 的 6.51,接近 SenseNova-U1 8B 的 7.47;语义一致性强,感知质量偏弱。GenEval 总分 0.84,BAGEL 0.82,SenseNova-U1 0.91;计数 0.69 偏弱,位置 0.83 偏强。DPG-Bench 86.49,关系项 94.97 是表内最高。OneIG-Bench 英文 0.561、中文 0.533,双语均分 0.547,风格项两边都最高。
统一多模态模型缺的常常是视觉接口还是两套,再堆一个专家补不上。这篇把改动收在补丁嵌入和通道拼接上,冻结骨干就能同时保语义和细节,8B 系统可以去掉独立 VAE。想做理解-生成一体、又想复用现成 SigLIP 或 Qwen-ViT 的人,这条路径比重训视觉骨干便宜。
它没有在生成 FID 上压过 RAE,也没有在 ImgEdit 上压过专用 20B 编辑模型。卖点是同一块冻结视觉空间能把三件事接到能用的水平。
作者写明,UniSpace 主攻生成和编辑,系统级理解仍落后专用视觉语言模型,论文也不拿 UniSpace 的 VLM 分数当主证据。编码器要同时服务生成,理解数据上不能随便解冻,否则生成会被带偏。Hybrid 编辑 2.70、GenEval 计数 0.69,说明组合编辑和计数仍不稳。GEdit 上感知质量弱于语义一致性。Tokenizer 侧重建变好、gFID 变差,统一表征对生成先验并不免费。训练数据是内部整理的,14.2 万 NPU 小时也不是小实验能复现的设置。