Generation as Auxiliary Supervision: Enhancing Visual Understanding at Zero Inference Overhead via Decoupled Embedding Prediction
Zhongbin Guo, Jiahao Xie, Dongling Xiao, Qianle Wang, Ruiqi Lu, Xiaomin He, Wanxuan Sun, Cheng Yang
cs.CV
2026-08-13
字节团队把视觉生成改成辅助监督:在 MoT 解耦架构里用 Next Embedding Prediction 预测连续视觉嵌入,训练完丢掉生成分支;2B 模型 16 项基准综合分从 47.25 涨到 48.25,推理开销严格为零,训练多花 11.6% GPU 时。
纯文本的下一 token 预测对视觉感知只有间接监督:模型学会谈论图像,却从没被迫从图像里学。语言天然有表达力瓶颈,精确空间关系、像素级边界这些细节文字说不清。统一多模态模型(UMM)试图联合训练理解与生成来补这块,但两个老问题没解决:生成侧参数推理时还得带着,延迟内存都吃亏;生成目标为合成质量优化,不为理解增益优化,理解分经常原地踏步甚至倒退。
GAS 的原则就一句:生成任务只当训练期的辅助监督,不改变推理时架构与开销。三个组件咬合。
训练分两阶段:先冻结理解侧只训生成分支对齐,再联合训练,NEP 损失权重从 0.015 线性升到 1.0。
2B/4B 两个规模、16 项基准四个维度(通用感知、视觉推理、计数与空间、视频)。2B 规模配对对比:
| 指标 | baseline | GAS |
| Overall | 47.25 | 48.25 |
| CountBenchQA | 87.7 | 90.1 |
| CV-Bench 2D | 69.9 | 73.2 |
| MathVista | 54.4 | 56.4 |
| DynaMath | 46.2 | 47.9 |
4B 规模 GAS 在统一模型家族里总分最高,MMMU 57.0、CharXiv-DS 78.4,压过 7B+7B 的 BAGEL 和 8B 的 Emu3。提升集中在感知与空间维度,正是定位/分割任务瞄准的能力。
机制拆解的对照组很干净:多训 11% 理解数据只涨 0.48;把生成数据混进来但不监督图像输出,分数反而掉 0.11;NEP 直接挂共享主干(不隔离开),Overall 掉到 54.95 一类广泛劣化;MoT 挂空(无生成损失)涨到 47.63 但不如完整 GAS。生成数据本身不是监督,「NEP 供信号 + MoT 隔离」这对组合才是。
任务相关性实验:同一份 200k T2I 数据,通用短提示只涨 0.24 且感知倒退 0.75;把提示重写成带世界知识、多物体组合、属性关系线索的版本,Overall 涨 0.71 且四个维度全面向上。迁移效果随任务相关性走,不随样本量走。
层位实验:第 14 层(约 L/2)分叉最好,第 8 层空间维度最强,第 20 层偏差;解冻 ViT 掉 1.65 个点,证明生成梯度该走投影层而不是腐蚀编码器。
表示层诊断给机制背书:GAS 在深层保留更高视觉信息余弦相似度,RefCOCO 线性探针从第 8 层起拉开差距(ImageNet 全程持平,说明增益在区域级细粒度而非全局语义),注意力图在深层保持聚焦而 baseline 在 20 层后发散。纯文本推理没受伤:ZebraLogic +2.8pp、MMLU-Redux +1.23pp。重复实验显示 2.5B 规模 GAS 三次跑 Overall 48.46±0.37,baseline 47.25,增益稳定。
对训 MLLM 的团队,这是一条便宜的可插拔增强:训练多花 11.6% GPU 时,推理严格零开销,从零训练、预训练后、SFT 后三个阶段都能加,且都能涨。任务相关性那条结论对数据构造有直接指导:与其堆生成样本量,不如把生成指令改造成逼模型做空间定位与组合推理的形态。对统一模型的路线之争,这篇把「理解与生成冲突」的矛盾拆成了架构问题(MoT 隔离可解)与目标问题(NEP 同域可解),不再是二选一。
增益幅度要诚实看:Overall 1 个点上下,单基准多数在 13 个点,离「生成改变理解」的强版本还远;4B 上 VisuLogic 反而倒退(26.8 到 23.6),作者归因于该 puzzle 型基准对规模敏感,但这暴露了转移的不均匀。主模型从零训练,只有 2B/4B 两个规模,没在更强底座或已对齐的商用级模型上验证。10M 生成样本全自动合成,质量只靠管线设计保证,没有人工抽检数字。ViT 全程冻结的设定下,「解冻 ViT 有害」的结论不能外推到 ViT 也参与理解训练的常规配置。论文来自字节,与 BAGEL 等统一模型的对比引用公开报告数字而非自测,口径不完全可比。