Iris-3B: Going Beyond the Latent with Pixel-Space Diffusion Training, Conversion and Fine-Tuning
Hanqiu Li Cai, Chema Garabito
SperidLabs
cs.CV, cs.AI
2026-10-07
SperidLabs从零训练3B像素文生图模型Iris-3B,1024分辨率OneIG总分0.540,与Qwen-Image持平;微调后做单目深度和四倍超分,像素空间先验没有明显优于潜空间对照。
潜空间扩散把生成放进 VAE 压缩空间,高分辨率才训得动。VAE 单独训练且重建有损,丢掉的细节生成器够不着;深度和修复的输出还要再过一遍为自然照片优化的解码器。细结构在这里是结构限制,所以像素空间骨干理应更适合这类任务。
JiT、PixelDiT 已经让像素生成在画质上接近潜空间,也有工作能把训好的潜空间模型转过去。这些比较停在生成和理解。SperidLabs 把两条路都做了:从零训练 3B 的 Iris-3B,并把 FLUX.2 Klein base 4B 转成像素空间,再一起微调单目深度和四倍修复。预期没有站住。
配方在 1.3B、256 分辨率上选定。v 预测训练稳定,与直接预测干净图的 x 在 GenEval 上打平,x 的 DPG 和 FID 更差;x 那支还改了时间步分布,所以没有单独隔离目标。表示对齐里 DINOv2 的 REPA 最强,DINOv3 让 GenEval 和 FID 变差,iREPA 的 FID 优势到 25 万步基本消失,GenEval 与 CLIP 几乎全程落后。Self-Flow 全程落后。放大时留下 v 和 DINOv2,REPA 只在 256 阶段以权重 0.5 打开。
Iris-3B 在 RGB 上做 flow matching。16×16 patch 使 1024 图变成 64×64 token。主干为 8 个双流块加 16 个单流块,宽 2560;注意力是 20 个 query 头、5 个 KV 头的 GQA。时间步不再每块一套 adaLN,改成每条流一个共享投影加每块偏置,同样计算量下参数少 28%。四层 PiT 头用 patch token 调制每个像素,注意力前先把一个 patch 压成 1280 维。文本侧冻结 Qwen3-VL-4B-Instruct,读 12 层,再经两层 refiner。二维轴向 RoPE 不绑分辨率,三阶段共用权重。优化器为混合 Muon,学习率 1e-4,1024 阶段降到 5e-5。样本约 3.76 亿、1.67 亿、4860 万,SFT 再加约 2050 万。1024 阶段非照片内容占多数。
转换时,随机输入投影喂给主干的分布它没见过,最好的线性映射只能解释 latent 嵌入方差的 14%,1K 步后仍是与提示无关的块状噪声。增益匹配的岭回归初始化,再把主干学习率缩到头学习率的 0.12 倍,以抵消偏小的主干权重。在 batch 8 的探测里,两者合用,1K 步内就能出图;单独使用至少把损失砍半,仍无连贯图像。正式训练 batch 112,下游取 PiT 头的 3 万步权重。生成指标没有测。
深度三家共用直接回归:空提示、零噪声、最后时间步,预测相对对数深度。像素模型用卷积从 RGB 读出,潜空间模型先过冻结 VAE。损失是 L1 加 5 倍梯度项,学习率 3e-5,batch 32,1 万步,数据只有 Hypersim 与 Virtual KITTI 2。这条回归事先赢过 flow 目标。四倍修复按 HYPIR 做一步生成,损失为 L2、5 倍 LPIPS 和 0.5 倍对抗项。FLUX 的像素版与潜空间版在数据、损失和日程上对齐,训到 3 万步。Iris 的 batch、日程和推理后处理都不同。
发布权重在 1024、CFG 3、100 步、每条提示 4 张、不改写、不做 best-of-N 的设置下,用官方评测器计分。
| 模型 | GenEval | DPG | LongText | OneIG |
| FLUX.1-dev 12B | 0.66 | 83.8 | 0.607 | 0.434 |
| Qwen-Image 20B | 0.87 | 88.3 | 0.943 | 0.539 |
| Z-Image 6B | 0.84 | 88.1 | 0.935 | 0.546 |
| Iris-3B | 0.798 | 86.52 | 0.857 | 0.540 |
Iris-3B 全面高于 FLUX.1-dev。OneIG 0.540,与 Qwen-Image 的 0.539 持平,略低于 Z-Image 的 0.546。GenEval 0.798、长文本 0.857,仍低于 Qwen-Image 的 0.87 和 0.943。i1 的 DPG 是 86.7,与 Iris 的 86.52 接近;i1 和 Z-Image 的 GenEval 都是 0.84,但用了提示改写。Iris 强在单物体、双物体和颜色,弱在位置与计数。
深度用 Marigold V2 的零样本协议,每张图可拟合尺度和偏移。SEE 衡量细边缘。
| 模型 | 平均 AbsRel↓ | 平均 δ1↑ | Hypersim SEE↓ |
| Klein latent | 0.072 | 0.947 | 0.528 |
| Klein pixel | 0.081 | 0.934 | 0.526 |
| Iris-3B | 0.071 | 0.946 | 0.496 |
Iris 与潜空间 Klein 的均值打平:DIODE 上 AbsRel 0.082 对 0.107,KITTI 上 0.083 对 0.086,但 NYUv2 是 0.057 对 0.050。像素 Klein 平均 0.081,五个集里除 KITTI 外都更差。方向一致的差距只有短转换后的模型更差。
16×16 边界上的曲率比显示,潜空间模型约 0.97 到 0.99;像素 Klein 约 1.31 到 1.44;Iris 在 Hypersim 为 2.14,DIODE 为 2.25。不重叠分块,各 patch 主要从自己的 token 解码,边界可以断开。VAE 解码器感受野重叠,接缝被抹平。
四倍 DIV2K 上,潜空间 Klein 的 PSNR、SSIM、LPIPS 为 20.99、0.557、0.275,像素 Klein 为 20.87、0.504、0.274。MUSIQ 分别是 67.11 和 67.03,潜空间版 NIQE 为 3.26。SSIM 和 NIQE 差距最明显,LPIPS 持平。Iris 为 20.68、0.481、0.292,NIQE 3.94,落在两家之间,DeQA 3.87,略低于两家,MUSIQ 68.01 为全表最高。SeeSR 的 PSNR 22.25、SSIM 0.580,Real-ESRGAN 的 MUSIQ 只有 60.37。像素模型的观感分进了开源修复方法的前列,没有超过潜空间孪生。
PiT 头加上从零预训练,可以把没有 VAE 的文生图拉到 3B 和 1024。官方 OneIG 上与 20B 的 Qwen-Image 持平。权重和训练代码已公开。共享 adaLN 少掉 28% 参数,RoPE 也不绑分辨率。
稠密预测上,对齐过的设定里看不到像素先验的优势。去掉有损压缩,并不自动换成更准的深度或更锐的修复。报告把更该出现优势的地方放在编辑:未改区域要逐像素复现,有损 latent 理论上最吃亏。这项实验没有做。
Iris 没有潜空间孪生,深度对比混进了参数量、数据和算力。成对比较用的父模型只转换了 3 万步,生成指标又没测,「先验更弱」仍是猜测。每条下游都是单次、短预算、无显著性检验。Iris 的修复臂还在 batch、日程和后处理上不对齐。1024 预训练以非照片为主,真实图像的细节先验是否被稀释,没有拆开。
x 与 v 的消融同时改了时间步分布。岭回归和缩小主干学习率只在 batch 8、1K 步上看到效果,公开转换所用的 batch 128 没有再试。PiT 在像素分辨率上不让边界两侧的像素一起计算,网格是结构结果,打在像素空间想保住的细结构上。