北大 DC-SAE 实现 32 倍压缩,扩散训练收敛更快更省
DAGroup-PKU · hf · 2026-10-01
高压缩 tokenizer 对扩展潜空间图像生成模型至关重要,但激进压缩常导致扩散训练收敛慢、重建细节丢失。北大 DAGroup-PKU 提出解耦紧凑语义自编码器 DC-SAE:宏观层面用预训练语义编码器支持更高压缩比,像素级编码器保留低层细节保证高保真重建。
在 ImageNet 512×512 上,DC-SAE 达到 32 倍空间压缩,PSNR 29.79、gFID 3.37,相比此前最强的高压缩 tokenizer DC-AE 分别提升 13.5% 和 54.9%,吞吐相当且扩散训练收敛更快。文本到图像方面,1.6B 参数 DiT 配合 DC-SAE 在 1024×1024 分辨率下 GenEval 0.84、DPG-Bench 86.007。
「研究」频道最新
- Nature Genetics 论文发布 ArchMap:免代码单细胞数据比对参考图谱平台 — burny_tech · 2026-10-01
- arXiv 新论文:用世界文学方法构建有文化素养的 AI — begusgasper · 2026-10-01
- NVIDIA 发布 Instant NuRec:1.5 秒前馈重建驾驶场景 3DGS 世界 — rsasaki0109 · 2026-10-01
- KV-streams 方法让 SWE Agent 训练提速 2 倍且不掉点 — burny_tech · 2026-10-01
- 用「自我」替代「人格」?模型心理学术语之争引热议 — repligate · 2026-10-01
- 硅微环调制器突破单通道 200Gb/s,为 AI 光互连降功耗 — jwt0625 · 2026-10-01