KATok 按内容丢掉冗余 token,把视频压缩比拉到 253 倍

Keep-or-Drop? Adaptive Tokenizer for Compact Video Representation

Yeonkyeong Lee, Hyunsung Go, Jongmin Kim, Sewoong Lim, Donghoon Lee

cs.CV

2026-08-25

KATok 让视频 tokenizer 自己按内容决定留多少 token,丢掉没有信息的时空格子。256²×16 平均只用 366 个 token,重建 PSNR 31.24,下游生成训练比 OmniTokenizer 快约 6.9 倍。

这篇在解决什么

潜空间扩散已经是视频生成的主流:VAE 先把视频压进 latent,再在里面做 diffusion 或 flow matching。常规 VAE 的压缩比是死的,空间和时间一涨,token 数跟着线性涨。视频里大量区域是静止背景或均匀纹理,固定配额等于在给没信息的格子烧算力。

FlexTok、ElasticTok 这类可变长度 tokenizer 把选择权交给用户或推理时搜索:想画质好就多留 token。灵活不等于自适应。KATok 要的是模型自己看内容复杂度,决定这条视频该留多少 token,下游生成不再做预算搜索。

方法

编码器是带 3D RoPE 的 transformer,视频切成 16²×8 的三维 patch,每个 token 出对角高斯参数。一个轻量重要性网络给每个 token 打 keep/drop 两维 logit。训练时用 Gumbel-Softmax 得到软掩码,乘到 latent 上;推理时硬切。同一套软掩码还去调解码器注意力,丢掉的 token 在解码端也看不见。

稀疏正则是对软掩码的 ℓ1,权重退火:前约 5k step 几乎全留,稳住之后再加压。解码器走 FLUX 式双流,用可学习 query 重建;编码粗、解码细(8²×4),只加 query 数量、不加 latent 数量。两个 register token 当全局锚点。

稀疏 latent 直接拿去生成会错位:剩下的 token 对不上原来的时空位置。两条补丁。联合生成让内容和位置一起做 flow matching,噪声日程解耦。级联则先用一个 8.3M 的 mask prior 预测哪些格子该亮,再把位置编码喂给主生成器。默认用级联,生成器是 SiT-XL。

结果

Panda-70M 验证集约 5000 条:

方法分辨率平均 tokenPSNRrFVD
Omni-VAE256²×16512028.107.84
ElasticTok-KL256²×16384630.5212.37
KATok256²×1636631.245.12
Omni-VAE512²×323686424.0716.85
KATok512²×32155433.236.40

压缩比从 134 升到 253。token 数与时间熵的 Pearson r 约 0.87,高于空间熵的 0.62:运动多的片段多留,纯白视频 256²×16 只需 28 个 token。

生成 gFVD,100K 次迭代、越低越好:

方法SkyUCF-101Kinetics-600
Omni-VAE23.28100.00206.58
ElasticTok95.53712.56-
KATok-Cascaded23.1961.53160.84
KATok-Joint21.3673.16193.78

UCF-101 拉到 200k step 时,Cascaded 的 gFVD 是 49.34,OmniTokenizer 是 82.31;80k step 已经 73.81,超过对方 200k 的成绩,墙钟约 6.9 倍。推理吞吐 15.71 条视频/秒,是 OmniTokenizer 的 3.2 倍。去掉 soft attention mask 或 Gumbel-Softmax,训练崩到只剩 2 个 register token。

为什么重要

视频 tokenizer 的瓶颈经常不在能不能压,而在会不会按内容分配。KATok 证明自适应丢 token 不但能少算,生成质量还能更好。token 数甚至能当运动复杂度旋钮:200 个 token 更简单、400 个更动。对要训长视频或高分辨率 latent diffusion 的人,这是一条少 token、快收敛的路。

主对比锁在 transformer 加连续 KL VAE 这一范式,和 Cosmos、LTX-Video 那些 CNN VAE 的对照放在附录。

局限与存疑

没有单独的局限节。生成实验是 256²×16 的无条件或类别条件,不是文本条件的大规模视频生成,距离可上线的 text-to-video 还有一截。ElasticTok 因算力只评了 Sky 和 UCF,Kinetics 缺席。级联依赖额外的 mask prior,联合生成对噪声日程敏感。latent 正则会略伤重建、换生成,是刻意权衡。token 数当控制信号是统计涌现,没有单独的条件模块保证。机构是 Kakao,项目页在 kakao.github.io/KATok。

术语

原文与代码

相关论文

全部论文解读