研究者称,图像编码器越大,REPA 可能越不灵了
SeunghyunSEO7 · x · 2026-07-29
这条讨论的是一个很具体的图像生成研究问题:当模型规模继续变大时,是否还应该用一个较小的、在 ImageNet 上训练过的外部 encoder 作为视觉编码器初始化。
发帖者认为,虽然 REPA 在图像生成领域影响很大,但在更大规模下,或许不该再依赖 0.6B~1B 级别的外部编码器,而是让模型从头学习表征。配图里的两点结论很关键:一是随着 DINO 规模从 v2-B 到 v3-H+ 增大,REPA 下生成质量反而可能下降;二是去噪梯度/辅助信号会从“助推器”逐渐变成“刹车”,说明训练机制和推理目标之间存在更复杂的尺度效应。
所属事件:研究称视觉编码器预算充足时从头训练更优(3 条相关)→
「研究」频道最新
- 开源模型在 NGINX 中发现 6 个漏洞、5 个 CVE — cyb3rops · 2026-07-29
- LLM 多智能体工作流挖出 Nextcloud 等开源 0-day — cyb3rops · 2026-07-29
- cnsplots 用少量代码生成论文级科研图表 — KevinKaichuang · 2026-07-29
- PostTrainBench v1.1 揪出 234 个污染跑分并重排榜单 — karinanguyen · 2026-07-29
- 混合人机评测流程图:LLM judges 至少 15 标签、IRR 约 0.40 — IanArawjo · 2026-07-29
- AI 研究正从单卡 3090 跳到 NVL72 级集群 — _xjdr · 2026-07-29