像素空间文生图实操指南:先潜空间预训练再迁移,4 步出图只要 0.2 秒

An Empirical Study of Training Pixel-Space Text-to-Image Diffusion Models

Dengyang Jiang, Ruoyi Du, Zhennan Chen, Dongyang Liu, Zanyi Wang, Mingzhe Zheng, Xiangpeng Yang, Huanqia Cai, Aiming Hao, Yuming Jiang, Peng Gao, Harry Yang, Steven Hoi

cs.CV

2026-08-18

在 Z-Image 与 FLUX2-klein 上的受控实验:像素空间直接预训练收敛显著慢于潜空间,潜转像素后训练(自生成数据混真实图、x-prediction、DiP 轻量解码头、噪声尺度 γ=2)追平质量,配合大 patch 与步蒸馏端到端提速 3.18~4.75 倍。

这篇在解决什么

主流文生图扩散模型都在 VAE 潜空间里做去噪,这带来三个代价:潜压缩有信息损失,重建质量封顶;训练大 VAE 本身烧钱;推理时多一步 VAE 解码延迟。像素空间扩散(直接学 RGB、直接生成 RGB)绕开这三条,但此前的系统研究停留在 ImageNet 类条件生成或小规模文生图,「怎么在大规模文生图上训出一个能打的像素空间模型」没有现成答案。

这篇论文把这套空白填了:先证明为什么不能从零直接训,再逐项拆解迁移期每个设计选择,最后拼成一条完整配方。

方法

第一阶段回答「从零训行不行」。用 Z-Image 完全相同的架构、数据(超过 200 亿图文对)、算力和配置,只换预测空间。潜空间全程领先,早期差距最大:潜模型很快抓到物体结构和图文对齐,像素模型迟迟出不了成形结构。原因在 VAE 不只是压缩器,它是学出来的紧凑视觉表征,压制局部冗余和高频波动,让扩散模型面对的分布好学得多。

于是主方案是潜转像素迁移,论文逐项给出五条结论:

效率侧再叠两招。patch 尺寸渐进适配:先在 ps16 迁移到像素空间,再适配到 ps32,token 数砍四分之三质量几乎不掉;直接训 ps32 会同时换预测空间和粗化 token 网格,收敛慢且出局部伪影。继续到 ps64 再砍 4 倍就伤细节了。最后上步蒸馏(Decoupled-DMD、DMDR),像素空间没有 VAE 解码这个固定开销,少步化的收益能直接兑现成端到端提速。

结果

模型NFE延迟(s/1024²)GenEvalDPG
Z-Image(潜空间)10020.120.751086.91
本方案(像素)1004.56(4.41×)0.764487.60
Z-Image-Turbo(潜)40.950.762585.31
本方案 Turbo(像素)40.20(4.75×)0.769886.85

FLUX2-klein 上同配方 3.183.29 倍提速、多数基准反超,证明配方不止在一家人身上灵。相对此前的潜转像素方法 L2P,四项基准全胜且延迟大幅更低。像素迁移本身只带来 1.10 倍加速,大头来自大 patch(到 4.41 倍)加步蒸馏;三招叠满,对原始潜空间管线总提速 100.6 倍。

为什么重要

这是一份可以直接照抄的工程配方,不是概念验证。对要自建或改造文生图管线的团队,结论有三层用处:像素空间别从零预训练,潜空间的先验直接继承;效率的三个来源(去 VAE、大 patch、步蒸馏)互相正交可叠加;4 步 0.2 秒出 1024² 图把交互式应用的单图成本压到了新档位。

DiP 解码头那条质量-效率权衡也值得单独记:2.25B 参数的 Transformer 头换来的 GenEval 提升,在延迟账上完全不划算,轻量卷积头加局部性偏置是更聪明的解法。

局限与存疑

训练侧的结论建立在单一预算下「像素收敛更慢」的观察上,没有给出把预算拉长后两者是否终会持平,只说了同预算下追不上。效率数字全部测在单张 H800、明确不做 FlashAttention 等系统优化,工程化部署的实际收益会因推理栈而异。ps64 的失败只做了现象描述(局部细节退化),没有归因分析。基准覆盖 GenEval、DPG、OneIG、LongText 四项,美学主观质量和极端长文本等维度没有人类评测。另外整篇是自家的 Z-Image 主场,FLUX2-klein 只验证了速度与多数基准,没有逐项拆解迁移期设计在该家族上是否同样成立。

术语

原文与代码

社区讨论

相关论文

全部论文解读