PixelDense:用密集预测教师替代语义编码器做 REPA,GenEval 提至 0.8093

Lehan Yang · hf · 2026-10-02

针对表征对齐(REPA)加速扩散 Transformer 训练时几乎只用 DINOv2/CLIP 等语义编码器的现状,作者发现空间结构而非全局语义才是对齐效应的载体,于是把密集预测基础模型引入像素空间扩散:SAM2、Depth Anything v2、Metric3D v2 单独使用均超过 DINOv2 基线,但四教师简单相加反而低于最佳单一几何教师——语义与几何梯度会竞争同一个去噪器投影。PixelDense 的解法是双投影流:DINOv2 与 SAM2 走语义投影流,Depth Anything v2 与 Metric3D v2 走几何投影流,并加权重空间正交惩罚使两流处于不相交子空间;训练时四教师全部冻结、推理时丢弃。统一配方应用于 PixelGen 与 DeCo:PixelGen-XXL 的 GenEval Overall 从 0.7927 升至 0.8093,部分噪声重建中全景/深度/法线探针在 τ=0.5 时 PQ 最高提升 53.1%、深度 AbsRel 降低 36.0%,从随机初始化达到基线峰值 GenEval 快 1.23 倍,SDEdit 编辑中背景 PSNR 最高提升 2.2 dB。

原文链接 →

「多模态」频道最新

更多「多模态」频道 AI 资讯 →