视频扩散仍在依赖八到十一年前的评测指标
kalomaze · x · 2026-07-23
这条帖子的核心观点是:视频扩散和 world modeling 的讨论,很多时候仍在用过时的评测工具来衡量。
配图直接点出几个关键指标/特征提取器的“年龄”:Inception-v3 发布于 2015 年,FID 和 I3D 都是 2017 年,FVD 也只是 2018 年。作者想表达的是,不少扩散模型基线仍然靠这些老分类器和老指标打分,当前进展是否被“旧工具”准确衡量值得怀疑。
「研究」频道最新
- 多智能体基准落后 39% 到 70%,AgenC 改用单 agent — tetsuoai · 2026-07-23
- AgenC 读完两篇论文后把 swarm 默认改成单 agent — tetsuoai · 2026-07-23
- FLOC26 面板将讨论 AI 进展对 CS 和形式化方法的影响 — swarat · 2026-07-23
- LLM 的价值,可能在反编译后的人工精修阶段 — OwariDa · 2026-07-23
- RLSS 2026 米兰把 Bellman backup 讲成了咖啡局 — misovalko · 2026-07-23
- RLSS 2026 米兰大师课讲世界模型与 RL,共 23 页 — misovalko · 2026-07-23