Dino Forcing 论文:直接预测预训练表征,收敛快一倍且 FID 更优
kastnerkyle · x · 2026-10-10
ENPC 与 Ecole Polytechnique 等机构发布论文《Dino Forcing Flow Models: Do not denoise what you can predict》,提出比 DINO 共去噪更简单的表征引导方案:不引入第二条去噪轨迹,而是直接预测 DINO 预训练表征,再让模型以自身预测为条件,从而免去第二条 ODE 和针对表征的去噪调度设计。
实验结果:在 ImageNet 上,潜空间方法用比此前 SOTA 少一半的训练轮数即取得更优表现;像素空间 FID 较可比方法提升超过 20%。核心结论一句话:能直接预测的就别去噪(do not denoise what you can predict)。代码已开源。
「研究」频道最新
- Adobe 推出 OmniSeek:让 Omni 模型主动检索音视频证据做多轮推理 — mohitban47 · 2026-10-10
- 研究:参数化神经控制可区分灵长类视皮层顶级视觉模型 — Dr_Alex_Crimi · 2026-10-10
- 架构论文阅读清单流出:Mamba-3 两周前新法可做非交换状态追踪 — zmkzmkz · 2026-10-10
- Dex-One2Many:一条人类视频训出多种构型操作机器人 — furongh · 2026-10-10
- 零图文配对也能对齐:DINOv2 与 Qwen3 嵌入空间被成功桥接 — NandoDF · 2026-10-10
- 2D 协同进化通信迁移到实体机器人:30 次实验仅 1 次成功 — uv-mex · 2026-10-10