Uncovering Understanding-Generation Synergy in Native Unified Multimodal Models: From Representation, Task to System
Penghao Wu, Haiwen Diao, Weichen Fan, Lewei Lu, Dahua Lin, Ziwei Liu
cs.CV
2026-09-02
南洋理工与商汤在无视觉先验的原生统一模型里测理解-生成协同。共用计算通路会一边压另一边;任务解耦后Geometry3K从59.90升到65.39。
统一多模态模型能在同一个网络里看图、出图,接口上已经统一。统一不等于互助:两个目标可能互相喂信号,也可能抢容量,也可能只是住在一起。已有工作结论打架,有的报严重干扰、主张拆通路,有的靠额外模块把理解信号灌进生成。这些效应常和预训练视觉编码器、VAE、辅助损失缠在一起,分不清是联合训练本身在起作用。
这篇把视觉接口收成像素进、像素出:没有预训练视觉编码器,也没有图像tokenizer或VAE,从Qwen3-1.7B接上随机初始化的预缓冲层,文本自回归、图像flow matching。在这个受控设定里,从表示、任务、系统三层看理解与生成何时互助、何时互踩。
先比两种路由。稠密共享:文本、干净理解视觉token、带噪生成视觉token全部走同一套LLM层。模态解耦MoT:文本留在预训练分支,所有视觉token进从零初始化的视觉分支。再加第三种任务解耦MoT:文本和干净图像走语言模型分支,带噪生成图像走专用视觉分支,两边仍共享注意力和文本语义。
表示层用SenseNova-U1的理解和生成数据,21万步。任务层三个案例:几何解题配几何图生成与编辑;SVG图到代码、代码到图;三维空间智能的VQA配自运动过渡、多视图重建、视图序列补全和布局生成。系统层拿推理型图像编辑,把同一批样本做成三种格式:端到端、只规划、只执行,对照端到端统一模型和规划器-执行器流水线。
稠密共享里,联合训练抬高理解、压低生成:Vision-centric & SI从60.72到61.77,HPSv3从7.05掉到5.92。模态解耦正好反过来:GenEval2从57.55到63.47,理解全面下降。探针显示生成监督会丰富理解用的视觉特征,理解监督会提高生成特征与文本的CKA对齐。问题是同一条计算通路上总有一方占主导。
任务解耦MoT两边都保住:理解三项均不低于稠密联合,GenEval2到63.96。几何上,Und+Gen把Geometry3K从59.90推到65.39,MathVista testmini从71.80到74.30;把同样生成数据改写成描述任务,增益更小且不稳定。SVG联合训练Image→SVG 80.64到81.70,SVG→Image 80.21到86.52,盲VQA从生成-only的49.41到58.54。三维空间智能理解九项均值57.15到59.01,生成端Spatial-Edit和视图补全也更好。
系统层,端到端UMM在RISEBench overall 18.88对规划器-执行器的16.66,KRIS-Bench 68.33对66.48。逻辑子项端到端9.41,流水线11.76,这一格是例外。
「一个模型既懂又画」本身不构成协同。协同依赖三件事:冲突的视觉计算要分开,共享的领域知识才值得联合训,理解和生成必须来回交互的任务才适合端到端。对练统一模型的人,默认稠密共享或按模态一刀切都可能把一边当正则项牺牲掉。任务解耦是一个能用的折中,不是唯一解,MoE按任务路由也在文中被点名为后路。
几何案例还有一层:学着生成和编辑图,比学着把同一批图写成文字,对解题更有用。
主干只有1.7B,结论能外推到更大统一模型多少,没有直接证据。只覆盖「文本自回归+图像连续flow」这一种主流配方,全离散或全自回归是否同构,作者自己列为未验证。任务层和系统层都建在任务解耦MoT上,所以后两层的增益不能反过来证明稠密共享也能协同。三维理解均值只抬了1.86分,幅度不大。RISEBench逻辑子项端到端更差,系统层优势不是每一格都成立。没有从零预训练整个多模态模型,语言能力仍来自Qwen3。