VoT: Vision-of-Thought for Unified Multimodal Representation Alignment
Jingxiang Sun, Chao Liao, Zhengxiong Luo, Chaorui Deng, Chen-lin Zhang, Junke Wang, Ceyuan Yang, Haoqi Fan, Weilin Huang
cs.CV, cs.AI, cs.CL
2026-09-08
字节跳动Seed在冻结的VLM与扩散分支之间插入可自回归的离散视觉思维token,21B模型在GenEval拿到总分0.91,高于基线Mogao的0.89和FLUX.1-dev的0.82。
现在主流文生图还是「文本编码器加扩散解码器」:提示词编成一段静态 embedding 或 KV cache,直接去调连续噪声。这条路在简单描述上已经很好用,但 VLM 里那种结构化的世界知识很难靠静态条件传给 DiT。模型其实「知道」该画什么,像素端经常画不准。
统一理解与生成的另一条路,是把图压成 VQ-VAE / VQGAN 那种像素码再自回归。这些码本为重建保真服务,token 又长又碎,统计上还偏长尾,跟 VLM 的语义空间对不齐。字节跳动 Seed 团队的 VoT(Vision-of-Thought)把问题收成一层:在冻结的 VLM 和扩散分支之间,插入可自回归、可被 VLM 读懂的离散视觉思维 token,先规划物体与布局,再渲染像素。
整条链路分三阶段。
Stage 0 训 tokenizer。图像先过冻结的 Qwen2.5-VL-7B ViT,再过一层可训 adapter,用 SimVQ 量化到 65536 × 128 的码本,后面接 6 层语义解码器去重建教师 ViT 特征。损失三项一起上:特征重建(让 token 保住视觉信息)、VLM 对齐(把量化后的视觉嵌入塞进冻结 VLM,用配对 caption 做语言模型交叉熵,逼 token 能被读懂)、标准 VQ 损失(码本加 commitment)。只做重建会变成压缩像素碎片,只做对齐又容易丢细节,两项放在一起才站得住。
Stage 1 把 VoT 分支接到 Mogao-14B 这套 Mixture-of-Transformers 上。三路并行:文本、VoT、扩散,各有独立 LN / QKV / FFN,KV 拼在一起做统一注意力。文本和 VoT 用因果掩码,扩散用双向注意力。VoT 专家从预训练 VLM 专家复制初始化,VLM 分支全程冻结。每张图预测 1024 个 VoT token,词表 65536。
Stage 2 联合训 VoT 与 DiT,目标是自回归交叉熵加扩散速度预测。为了推理时能做 classifier-free guidance,训练里 VoT 以 0.5 概率丢掉,VoT 在场时文本再以 0.1 概率丢掉,样本大概是 50% 纯文本、45% 文本加 VoT、5% 纯 VoT;另外随机遮住 0–20% 的 VoT KV,避免扩散分支把规划当拐杖。最终模型 21B(原 14B 加 7B VoT 分支)。附录给出总训练量 48 万 GPU 小时,其中预训练 36 万(75%),SFT 6.4 万,RLHF 仅 6000。
公开榜是 GenEval(553 条提示,每条 4 张图)。VoT 总分 0.91,高过生成专用的 FLUX.1-dev(0.82,带 LLM 改写)和统一模型 Mogao(0.89)、BAGEL(0.82)。吃分的地方主要在组合约束:计数 0.86 对 Mogao 的 0.83,颜色属性 0.82 对 0.80,位置 0.85 对 0.84。单物体两边都是 1.00,空间上的差距本来就薄。
内部 AutoEval 把消融写清楚了。Mogao 基线 53.12;只做 VLM 对齐、2B 教师是 58.67;加上重建和 1 层 encoder 到 64.64;教师换成 Qwen2.5-VL-7B 到 69.32;解码器加到 6 层(Exp.E)到 70.37;再加 SFT 和 RLHF(Exp.F)到 76.22。教师变强和重建约束,比单纯把自回归 loss 压低更有用:Exp.A 的 VoT AR loss 最低,AutoEval 却最差。
图 4 的内部指令跟随榜上,VoT 是 76.22,GPT-Image-1 是 79.69,Seedream 4.0 是 78.2,Gemini 2.5 是 69.24。正文写「超过 Seedream 4.0 和 GPT-Image-1」,和柱状图对不上。对外可引用的硬数字,仍是 GenEval 相对 Mogao 的 +0.02。
这是渐进改进,但切口清楚。MetaQuery、BLIP-3o 那类 query 条件是并行的,吞吐友好,缺的是和 VLM 同构的逐步规划。VoT 把视觉思维做成可训练的离散层,规划与渲染解耦,tokenizer 还闭环到 VLM 可读。做统一多模态的人可以直接借三件事:量化教师 ViT 特征而不是像素、对齐损失和重建损失一起用、用复制专家加冻结 VLM 控制训练成本。
代价也清楚。21B、48 万 GPU 小时,不是小改配置能跟的。冻结 VLM 保住了理解能力,也把系统锁成单向的「想完再画」。
附录自己承认:MoT 加冻结 VLM,只能做推理到生成的单向迁移,还没做双向联合优化,怕 catastrophic forgetting。
公开对比的 GenEval 增益很小,0.89 到 0.91,且没有报方差或多次种子。内部 AutoEval 不可复现,图文还互相打架。训练数据只写「大规模文生图数据集」,规模和配比没给。理解侧能力有没有掉,正文几乎没测。1024 个离散 token 的可解释也停留在说法上:没有把 token 译回物体或布局的定量可读性实验。RLHF 只占 1.3% 算力,却把 AutoEval 从 70.37 拉到 76.22,规划层和后训练各自贡献多少,分不开。