PixelDense:用密集预测教师替代语义编码器做 REPA,GenEval 提至 0.8093
Lehan Yang · hf · 2026-10-02
针对表征对齐(REPA)加速扩散 Transformer 训练时几乎只用 DINOv2/CLIP 等语义编码器的现状,作者发现空间结构而非全局语义才是对齐效应的载体,于是把密集预测基础模型引入像素空间扩散:SAM2、Depth Anything v2、Metric3D v2 单独使用均超过 DINOv2 基线,但四教师简单相加反而低于最佳单一几何教师——语义与几何梯度会竞争同一个去噪器投影。PixelDense 的解法是双投影流:DINOv2 与 SAM2 走语义投影流,Depth Anything v2 与 Metric3D v2 走几何投影流,并加权重空间正交惩罚使两流处于不相交子空间;训练时四教师全部冻结、推理时丢弃。统一配方应用于 PixelGen 与 DeCo:PixelGen-XXL 的 GenEval Overall 从 0.7927 升至 0.8093,部分噪声重建中全景/深度/法线探针在 τ=0.5 时 PQ 最高提升 53.1%、深度 AbsRel 降低 36.0%,从随机初始化达到基线峰值 GenEval 快 1.23 倍,SDEdit 编辑中背景 PSNR 最高提升 2.2 dB。
「多模态」频道最新
- 实测:用 Nano Banana 做图像编辑,效果直接看图 — tkasasagi · 2026-10-02
- 博主实测:Opus 5.5 剪视频很强,但无需求硬用产出多垃圾 — AlchainHust · 2026-10-02
- Reddit 用户用 AI 做出以假乱真的概念车动态视频 — Vashukanni · 2026-10-02
- Fable 5.5 曝光:网页能随经过图片的艺术风格实时变形 — lxfater · 2026-10-02
- 牛津 VGG 发布 SynCity 3000:一次生成全局连贯的大规模 3D 场景 — rsasaki0109 · 2026-10-02
- Omni-Embed-Mini:0.9B 参数统一嵌入六种模态且文本检索零退化 — _reachsumit · 2026-10-02