重建更好的图像 tokenizer 在统一 AR 里并不更好学,VQAv2 还会掉

Studying Image Tokenizers as Visual Languages in Unified Multimodal Models

Siting Li, Zhengyang Wang, Simon Shaolei Du, Xi Chen, Yang Liu

cs.CV, cs.CL

2026-09-09

Amazon FAR 用 Qwen3 纯自回归试验台发现:重建更好不保证联合可学性,图生文损失才是跨 tokenizer 更稳的信号。GigaTok 换成 DINO 判别器后,VQAv2 从 52.25 掉到 51.31。

这篇在解决什么

统一多模态模型把图像和文本塞进同一个自回归目标。图像 tokenizer 决定了视觉这边的「词表」,但业界仍习惯拿 rFID、ImageNet 探测精度,或者只看生成、只看理解的下游分来选 tokenizer。这些指标都不回答一件事:图像 token 和文本 token 被同一个模型、同一个 next-token loss 一起建模时,发生了什么。

Amazon FAR 和华盛顿大学搭了一个受控的纯 AR 试验台,把 tokenizer 当成视觉语言来量:任务分项验证 loss 怎么随数据和模型规模走,跟下游分什么关系,以及判别器、语义监督、词表大小这些设计轴改的是重建,还是联合可学性。

方法

骨干是 Qwen3(主实验 0.6B / 1.7B / 4B,配方校验用到 8B),词表扩进离散图像 token,加 <boi> <eoi>。图像统一 256×256、K=16×16 个 token,只比较单码本 tokenizer:IBQ(1024 / 8192 / 16384)、GigaTok 与 GigaTok-DINO、UniTok 与 UniTok-sem。持续预训练最多 6000 万样本(660 万纯文本 + 5330 万图文,文本与图文按 1:8 混),图文里 80% 做 T2I、20% 做 I2T,T2I 再抽 10% 做无条件生成。loss 只打在被预测的那段 token 上。然后用 490 万指令数据 SFT 两轮。

验证集各 5 万纯文本和 5 万图文,拆成四项 loss:text、无条件图像、T2I、I2T。下游看 GenAI-Bench、MJHQ-30K,以及 SFT 后的 VQAv2、GQA。配方 sanity check:Qwen3-8B 配 Chameleon tokenizer,看过 6000 万样本后 GenAI 0.73、WISE 0.38、VQA 均值 60.83,跟 Liquid-7B(9000 万样本,0.72 / 0.41 / 61.40)接近,MJHQ-30K 的 gFID 则差一截(10.55 vs 5.47)。

结果

四项 loss 都会随数据和模型变大而掉,但斜率完全不同,tokenizer 排序也会按任务翻脸。文本 loss 基本由语言模型初始化决定,图像侧 loss 才是持续预训练在改。T2I 几乎跟无条件图像 loss 一起走;I2T 虽也在文本词表上算,走势却跟纯文本 loss 不一样。

固定 tokenizer 时,T2I 和 I2T loss 都跟生成质量对齐。换 tokenizer 之后,T2I loss 和画质的关系会跟着图像词表漂移;用 log2(B) 做词表归一能消掉一部分,剩下的跟 rFID 有关。I2T 在共享文本词表上算,跨 tokenizer 更稳,SFT 前的 I2T 还跟 SFT 后的生成和通用 VQA 中等相关。TextVQA 这种要 OCR 的任务就不稳。

重建和联合可学性可以对着干:

TokenizerrFID↓Text↓I2T↓T2I↓GenAI↑VQAv2↑
GigaTok-DINO0.512.9491.6607.4370.72051.31
GigaTok0.812.9371.6617.4160.72052.25
UniTok1.862.8831.6706.2640.67057.21
UniTok-sem2.232.8731.6555.8480.69061.28

DINO 判别器把 GigaTok 的 rFID 从 0.81 打到 0.51,三项 loss 几乎不动,GenAI 仍是 0.720,VQAv2 从 52.25 掉到 51.31。UniTok 加上语义监督,rFID 从 1.86 变差到 2.23,三项 loss 全降,GenAI 从 0.670 到 0.690,VQAv2 从 57.21 到 61.28。消融显示文本侧变差来自图像 token 预测目标的干扰,不是 I2T;语义监督的 I2T 收益集中在 COCO 物体词,不像把局部视觉语法变简单。IBQ 词表 1024 / 8192 / 16384 对 loss 不是单调的,但 16384 下游最好,论文归到更高重建保真。

为什么重要

选 tokenizer 如果只看 rFID,可能把联合训练里真正好学的视觉语言丢掉,甚至在共享目标下把文本建模拖差。更可操作的信号是分任务看 loss,尤其 I2T:它跨 tokenizer 可比,还能提前透出 SFT 后的生成和通用 VQA。语义监督这种「重建变差、词更像词」的设计,在统一 AR 里可能比把判别器换成 DINO 更值。这是诊断工具,不是新的 SOTA 生成器。

局限与存疑

只覆盖 7 个固定长度、单码本离散 tokenizer,没动分辨率和 token 数 K,因为 K 一变就没法同时钉死「见过多少图像」和「见过多少图像 token」。loss 是透镜,不是 SFT 后选 tokenizer 的替代品,对 TextVQA 预测力弱。算力不够,没有从零训的完整 scaling law。PMI 和 n-gram 熵只是诊断,高阶熵有有限样本偏差。骨干只固定了 Qwen3 纯 AR,不保证换家族排序不变。下游只有有限生成和 VQA,没有区域定位和细粒度空间推理。8B 配方在 MJHQ 上明显落后 Liquid-7B,试验台「够用」不等于生成质量打平。

术语

原文与代码

相关论文

全部论文解读