北大 DC-SAE 自编码器:32 倍压缩下 gFID 较 DC-AE 低 55%,吞吐快 4.4 倍

DC-SAE: Deep Compression Semantic Autoencoder for Faster Diffusion Convergence

Xu Huang, Ye Huang, Zijun Liao, Yuwei Niu, Xiaojie Li, Menghan Zhou, De Wen Soh, Xiaotong Li, Daquan Zhou

cs.CV

2026-09-30

把冻结语义编码器与无约束像素编码器并联,DC-SAE 在 32 倍空间压缩下拿到 PSNR 29.79、gFID 3.37,自编码器吞吐比 DC-AE 快 4.4 倍。

这篇在解决什么

Latent 扩散模型的算力账里,latent 序列长度占大头。DC-AE 这类深度压缩 tokenizer 把空间压缩率推到 32×,单次前向变便宜,代价是 latent 更难学:扩散模型要多训很多步才收敛,省下的前向开销可能被额外训练步数吃掉。另一条路,RAE 用 DINOv2 这类预训练语义编码器替换 VAE,latent 有结构、收敛快,但基本停在 16× 压缩,而且语义特征天生丢纹理、颜色统计和高频细节,重建保真度不够。

硬把语义编码器推到 32× 行不行?把图像缩半再喂 DINOv2,256 分辨率下重建只剩约 15 PSNR,DiT 训 80 个 epoch 才 7.15 gFID,快收敛的性质也丢了。换成 MLLM 常用的后合并 token(avg pooling、learnable merger)更糟。诊断出的根因:语义编码器的训练目标本来就不为可逆重建服务,压到 32× 时信息丢失被放大。

方法

DC-SAE 用双流编码器把矛盾拆开,整体四个部件:

设计上最干净的地方是什么约束都没加:没有 KL 正则,没有 REPA 式表征对齐,没有 channel masking,全靠架构分工。语义流给 DiT 提供好学的结构,像素流提供重建容量。消融证明两路必须在同一个解码器里联合训练:先单独训像素自编码器、到 DiT 阶段才拼语义特征的 Late-Concat 变体,重建反而更好(31.91 对 29.79 PSNR),80 epoch 的 gFID 却是 5.64 对 4.02。收益来自联合训出的协同 latent,不是简单给 DiT 喂语义特征。

结果

ImageNet 512×512,同为 32× 压缩、DiT-XL 骨干:

方法PSNR↑rFID↓gFID↓
DC-AE f32c3226.250.207.47
DC-SAE29.790.163.37

PSNR 升 13.5%,gFID 降 54.9%。自编码器吞吐在 1024×1024、H200、batch 32 下是 76.8 对 17.4 imgs/s(4.41×);256 和 512 分辨率分别快 4.64× 和 4.75×。

收敛性消融(32×、80 epoch):联合 latent 4.27 gFID,语义单流 7.15,像素单流 11.04。ImageNet 256×256 下,DC-SAE(f32c64)配 DiT-XL 加 DDT wide head 拿到 3.31 gFID、180.71 IS,同骨干配 DC-AE 是 10.18,DC-AE 换专用 USiT-H 骨干也要 3.89。16× 设置下 DC-SAE 是 27.80 PSNR、3.09 gFID,RAE 同设置约 19 PSNR、7.90 gFID。

文生图:1.6B DiT 加 Qwen3-1.7B 文本编码器,1024×1024 带 CFG,GenEval 0.84,DPG-Bench 86.007。对照的 12B DC-Gen-FLUX.1-Krea(DC-AE 版)是 0.72 和 87.073。

论文里最诚实的一个实验:把语义支路整个掩掉,重建几乎不变;掩掉像素支路,重建严重崩坏。重建能力基本住在像素流里,语义流的贡献是给生成器一个结构化的 latent 空间。

为什么重要

做高分辨率图像或视频生成,tokenizer 压缩率直接乘在序列长度上。DC-SAE 给出的信号是:32× 压缩下「重建好」和「收敛快」不必二选一,而且不用叠加复杂 latent 正则,架构分工就够,代码权重都已开源。pre-merge 的结论对做 MLLM 高压缩视觉 token 的人同样有参考价值:压 token 要放在语义抽象之前。

局限与存疑

54.9% 的提升是同骨干对照下的数字。同表 8× 压缩基线里 EDM2-XXL 到 1.91 gFID,DC-AE 配 USiT-2B 骨干到 2.90,都低于 DC-SAE 的 3.37,「大幅超越」只在 DiT-XL 对 DiT-XL 时成立。

文生图对照配置不同:基线是 12B 蒸馏模型,训练数据也不同(自家用 internal data 加 LAION-COCO),DPG-Bench 还略输约 1 分。这组实验能说明 1.6B 小模型有竞争力,说明不了 tokenizer 本身的优劣,论文自己也标注了配置差异。

收敛提速的证据是按 epoch 的 gFID 曲线加自编码器吞吐,同样 gFID 下端到端 wall-clock 总成本的对照没有给。语义支路为什么让 DiT 收敛更快,掩码实验之后剩下的仍是假设,机制层面没有验证。论文也只覆盖图像,视频还没碰。

术语

原文与代码

相关论文

全部论文解读