Self-Supervised Flow Matching for Scalable Multi-Modal Synthesis
Hila Chefer, Patrick Esser, Dominik Lorenz, Dustin Podell, Vikash Raja, Vinh Tong, Antonio Torralba, Robin Rombach
cs.CV
2026-03-07
Flux 团队的 Self-Flow 用双时间步调度让流匹配自学语义,甩掉外挂编码器;图像视频音频全超 REPA,625M 打赢 1B。
Flow matching、diffusion 这类生成模型有个老毛病:它们只被训练去噪,本身学不出强的语义表示。但好的语义表示又确实能让生成更快收敛、质量更高。当下最流行的解法是 REPA(Representation Alignment):训练时拿一个冻住的、专门学表示的外部模型当老师,典型是 DINOv2-B(8600 万参数),让生成模型的中间层特征去对齐它的特征。效果确实好,所以成了标配。
但作者(Black Forest Labs,也就是 Flux 背后的团队)指出这条路有三个根本问题。第一,它违背缩放律:换上更强的老师,生成质量不升反降,DINOv3-H+ 反而比最小的 DINOv2-B 还差。第二,它跨不了模态:做视频和音频时,对齐 V-JEPA2、Depth Anything 3、MERT 这些「对口」的外部编码器,结果比不对齐还差。第三,选哪个编码器全靠玄学,带文本监督的 SigLIP 2 在文生图上反而不如纯视觉的 DINOv2。外部对齐本质上给生成模型套了个固定的表示瓶颈。
核心机制叫 Dual-Timestep Scheduling(双时间步调度)。标准 flow matching 给所有 token 加同样程度的噪声,这个去噪任务靠局部相关性就能糊弄过去,模型学不到全局语义。Self-Flow 给不同 token 加不同程度的噪声,制造信息不对称:干净的 token 当上下文,去推算被严重污染的 token。
具体做法是采样两个时间步 t、s 和一个掩码 M(掩码比例不超过 0.5),被掩码的 token 用噪声 s,其余用 t。关键在于这样做保持了每个 token 的边缘噪声分布不变,推理时模型见到的仍然是均匀加噪的输入,不会出现训练与推理错位。
为什么不用更暴力的办法?作者对比了两种直觉做法:把一部分 token 直接全掩掉(t=1),或像 diffusion forcing 那样每个 token 独立采样噪声。两者都让生成质量明显下滑,因为训练时大量出现「各 token 噪声不一致」的输入,而推理时见不到,造成 train-inference gap。双时间步调度是这些方案的折中。
在此之上,Self-Flow 维护两个网络:学生 fθ 看到的是异质加噪的输入,EMA teacher fθ′ 看到的是用较小噪声 τmin=min(t,s) 加噪的较干净输入。训练目标是让学生从残缺的视角重建 teacher 的特征(用余弦相似度,对齐较浅层到较深层 l<k),再叠上标准的生成损失 L = Lgen + γ·Lrep。全程不碰任何外部编码器,只用模型自己的内部表示,所以天然能搬到不同模态和联合多模态训练。
ImageNet 类条件生成,Self-Flow 拿到 FID 5.70,超过用 DINOv2 的 REPA(5.89),尽管 DINOv2 本身就是在 ImageNet 上训的。作者称这是自监督方法首次在 ImageNet 上超过外部对齐。配上表示自编码器 RAE,FID 从 3.24 降到 2.95。
| 任务 | 指标 | Self-Flow | 最强对照 |
| 文生图(T2I) | FID↓ | 3.61 | REPA 3.92 / SigLIP 2 3.97 |
| 文生图 | FD-DINOv2↓ | 167.98 | REPA 173.35 |
| 文生视频(T2V) | FVD↓ | 47.81 | REPA 约 49.59;V-JEPA2 反伤至 53.55 |
| 文生音频(T2A) | FAD(CLAP)↓ | 145.6 | SRA 147.2;MERT 无益 148.9 |
文生图上最反差的一点:即便用 DINOv2 自己的特征算 Fréchet 距离(FD-DINOv2),Self-Flow 仍比直接对齐 DINOv2 的 REPA 更低,别的基线都追不平这个差距。视频和音频则更说明问题:对口的外部编码器(V-JEPA2、Depth Anything 3、MERT)不仅没帮忙,多数还让性能变差,只有 Self-Flow 全面领先。
缩放上差距更明显。在 290M→420M→625M→1B 四档上,Self-Flow 的领先随规模扩大,625M 的 Self-Flow 打赢 1B 的 REPA,而 REPA 自己出现收益递减。Figure 1 还给出收敛速度:比 REPA 快约 2.8 倍,且 REPA 早早见顶、Self-Flow 还在涨。
多模态和机器人方向也做了验证。单个模型同时训图、视频、音频,在各种加权下三项都同步提升;在 RT-1 机器人数据上做联合视频-动作预测,SIMPLER 仿真里 Self-Flow 全面领先,尤其在 Move Near、Open and Place 这类多物体、多步骤的复杂任务上,普通 flow matching 早期完全失败,Self-Flow 能成功。
这篇直接挑战了一个正在变成共识的做法:生成模型得靠外部编码器才能学好表示。如果结论成立,意味着下一代多模态生成模型可以甩掉外挂编码器这个既占显存又卡缩放、还挑模态的部件,用一个自监督目标统一图像、视频、音频甚至机器人动作。
对从业者来说,最实际的一点是缩放重新可控了:不用再纠结给视频配哪个 encoder、给音频配哪个 encoder,加算力就能换质量。考虑到作者阵容(Patrick Esser、Robin Rombach 都是 Stable Diffusion 与 Flux 的核心人物,基座用的就是 FLUX.2),这套思路很可能进 Flux 后续版本,值得持续跟进。
也要泼盆冷水:论文的对比基本集中在 625M 这个量级和受控数据集上,跟 SD3、已部署的工业级 FLUX.2 这种大模型的端到端对比没有给出;能否在外部对齐已经精调成熟的更大规模上保持优势,还要看后续。
作者自己承认:维护 EMA teacher 要多做一次前向,训练开销增加,不过靠加速收敛补回来了;噪声调度器 p(t) 需要单独调,它决定掩码行为,均匀调度比 logit-normal(α=1.78)更好。
几个存疑点:消融里去掉表示损失 FID 掉 4 分以上,说明收益大头来自自监督目标而非双时间步调度本身,但论文对 γ(两项损失的权重)和掩码比例 RM 的敏感度没有系统展开;文生视频只用了 6M 样本、625M 模型,规模偏小,「低资源下有效」的结论能不能外推到工业级数据量未知。外部对齐在不同模态上「反伤」的现象,作者归因于时序关系难学和帧间冗余可走捷径,但没给直接证据。