南洋理工新论文拆解:理解与生成何时能真正协同?
机器之心 · wechat · 2026-09-14
MMLab@南洋理工大学发布论文《Uncovering Understanding–Generation Synergy in Native Unified Multimodal Models》,在原生多模架构下从表征、任务、系统三个层次研究统一多模态模型(UMM)中视觉理解与生成是否互相帮助。
表征层面:DenseSharing 架构下联合训练使理解提升但生成下降;换成解耦的 MoT 后恰好反转。关键发现是二者都能为对方提供有价值的学习信号,但强迫共享同一计算路径会导致一个目标占据主导。论文提出 Task-decoupled MoT——理解 token 走 language-anchored 分支、生成 token 走专用分支,同时通过文本语义和共享 attention 保持联系,避免一边提升一边退化。
任务层面:能否相互促进取决于是否依赖相同的底层知识。几何推理、SVG、3D 空间智能三个 case study 都验证了双向迁移:如 SVG 双向联合训练后 Image→SVG 从 80.64 升到 81.70,SVG→Image 从 80.21 升到 86.52;几何生成训练的收益还迁移到 MathVerse、MathVista。仅把生成数据转成图像描述任务则无同样收益,说明「学生成」本身是独特的有效监督。
系统层面:在 reasoning-intensive image editing 上,端到端 UMM 在 RISEBench 和 KRIS-Bench 上都优于模块化 Planner→Executor 流水线,说明端到端优化本身就是能力来源。
作者认为 UMM 的价值在于:任务级共享底层知识(如具身智能中 world modeling 与策略学习可统一为 VLA+WAM 基模),以及系统级需要理解与生成持续交互的 agentic generation 场景。
「多模态」频道最新
- StyleGAN 3 高光时刻回顾:效果惊艳的老模型 — makeitrad1 · 2026-09-14
- ComfyUI 插件新增 RefMods,免训练参考素材打包进 safetensors — acedelgado · 2026-09-14
- ChatGPT-Image-2.5 上线 Nous Portal,可接入 Hermes Agent 使用 — Teknium · 2026-09-14
- GPT6 生成「印度老爹版 GTA」游戏视频,网友疯传 — Strict_Usual_3053 · 2026-09-14
- Hugging Face 作者做交互式 Flow Matching 可视化教程 — aritra_rg · 2026-09-14
- 网友用 Grok 让千年神庙雕塑动起来,还原古老造像原貌 — dhruv2038 · 2026-09-14