研究者称,图像编码器越大,REPA 可能越不灵了

SeunghyunSEO7 · x · 2026-07-29

这条讨论的是一个很具体的图像生成研究问题:当模型规模继续变大时,是否还应该用一个较小的、在 ImageNet 上训练过的外部 encoder 作为视觉编码器初始化。

发帖者认为,虽然 REPA 在图像生成领域影响很大,但在更大规模下,或许不该再依赖 0.6B~1B 级别的外部编码器,而是让模型从头学习表征。配图里的两点结论很关键:一是随着 DINO 规模从 v2-B 到 v3-H+ 增大,REPA 下生成质量反而可能下降;二是去噪梯度/辅助信号会从“助推器”逐渐变成“刹车”,说明训练机制和推理目标之间存在更复杂的尺度效应。

所属事件:研究称视觉编码器预算充足时从头训练更优(3 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →