北大 DC-SAE 实现 32 倍压缩,扩散训练收敛更快更省

DAGroup-PKU · hf · 2026-10-01

高压缩 tokenizer 对扩展潜空间图像生成模型至关重要,但激进压缩常导致扩散训练收敛慢、重建细节丢失。北大 DAGroup-PKU 提出解耦紧凑语义自编码器 DC-SAE:宏观层面用预训练语义编码器支持更高压缩比,像素级编码器保留低层细节保证高保真重建。

在 ImageNet 512×512 上,DC-SAE 达到 32 倍空间压缩,PSNR 29.79、gFID 3.37,相比此前最强的高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%,吞吐相当且扩散训练收敛更快。文本到图像方面,1.6B 参数 DiT 配合 DC-SAE 在 1024×1024 分辨率下 GenEval 0.84、DPG-Bench 86.007。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →