扩散模型研究仍大量依赖可被刷爆的 ImageNet FID 指标
kalomaze · x · 2026-07-23
- 这条讨论认为,扩散模型研究之所以常出现“能刷指标就行”的情况,很大程度上是因为主流参照物太单一,常被简化成类似 ImageNet FID 这样的“梗指标”。
- 作者强调,如果研究问题本身设计得更扎实,就没那么容易靠无限堆代理指标来做“reward hacking”。
- 另一层争论是视频扩散里的“世界建模”是否天然就要高得多的算力;作者的观点是,很多基线其实只是一直在用非常狭窄、历史遗留的评价标准,比如“来自奥巴马政府时期的分类器特征”。
所属事件:扩散模型研究反思:评测指标陈旧与架构强耦合隐患(7 条相关)→
「研究」频道最新
- 新基准显示,最强 VLM 仍画不准纯文本示意图 — East-Muffin-6472 · 2026-07-23
- DocOps 基准显示,前沿智能体仍难做好长链路文档操作 — Jiazhen Jiang · 2026-07-23
- 斯坦福软体机器人像藤蔓一样生长,专为救援狭窄空间设计 — lukas_m_ziegler · 2026-07-23
- 全球首个实体瘤 CAR-T 疗法获批,用于胃癌治疗 — Dr_Singularity · 2026-07-23
- 生产多智能体团队:别让 LLM 确定性,让编排层确定性 — njanChe1 · 2026-07-23
- 里斯本机器学习学校 LxMLS 2026 放出公开视频讲座 — caglar_ee · 2026-07-23