南洋理工新论文拆解:理解与生成何时能真正协同?

机器之心 · wechat · 2026-09-14

MMLab@南洋理工大学发布论文《Uncovering Understanding–Generation Synergy in Native Unified Multimodal Models》,在原生多模架构下从表征、任务、系统三个层次研究统一多模态模型(UMM)中视觉理解与生成是否互相帮助。

表征层面:DenseSharing 架构下联合训练使理解提升但生成下降;换成解耦的 MoT 后恰好反转。关键发现是二者都能为对方提供有价值的学习信号,但强迫共享同一计算路径会导致一个目标占据主导。论文提出 Task-decoupled MoT——理解 token 走 language-anchored 分支、生成 token 走专用分支,同时通过文本语义和共享 attention 保持联系,避免一边提升一边退化。

任务层面:能否相互促进取决于是否依赖相同的底层知识。几何推理、SVG、3D 空间智能三个 case study 都验证了双向迁移:如 SVG 双向联合训练后 Image→SVG 从 80.64 升到 81.70,SVG→Image 从 80.21 升到 86.52;几何生成训练的收益还迁移到 MathVerse、MathVista。仅把生成数据转成图像描述任务则无同样收益,说明「学生成」本身是独特的有效监督。

系统层面:在 reasoning-intensive image editing 上,端到端 UMM 在 RISEBench 和 KRIS-Bench 上都优于模块化 Planner→Executor 流水线,说明端到端优化本身就是能力来源。

作者认为 UMM 的价值在于:任务级共享底层知识(如具身智能中 world modeling 与策略学习可统一为 VLA+WAM 基模),以及系统级需要理解与生成持续交互的 agentic generation 场景。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →