8 讲浓缩斯坦福扩散模型课:全程只画一只泰迪熊
le_james94 · x · 2026-09-22
James Le 发布了 Stanford CME 296《扩散与大视觉模型》全部 8 讲(Afshine 与 Shervine Amidi 双胞胎兄弟讲授,约 14 小时视频)的浓缩整理。课程以「一只泰迪熊看书」的同一 prompt 贯穿 8 讲:从噪声 blob 到成图,逐层拆开 prompt 经过的每个环节——自编码器、去噪 transformer、guidance scale、评测基准,顺序覆盖 DDPM、score matching/SDE、flow matching、latent space、架构、训练、评测与领域走向。
作者还提出两个观点:
- 评测改革标准:只有当自动评测(judge)与人类的一致率超过人类彼此之间的一致率,分解指标才有意义。现 VIEScore+GPT-4v 与人类评分的 Spearman 仅 0.3,而人类之间为 0.45,差距明确。
- 遗留问题:没有一堂课量化最终图像中多少来自生成器、多少来自 VAE 解码器,作者征集做过这个拆分的实验结果。
「研究」频道最新
- SkillLift 用学习式评分替代真实 rollout,agent 技能进化省 40-70% token — dair_ai · 2026-09-22
- FAIR与NYU论文把缩放律推到4M参数,超参调优成关键 — giffmana · 2026-09-22
- Salesforce研究:让弱模型模仿强模型反降15%,纠错式微调才有效 — rohanpaul_ai · 2026-09-22
- Jevons 效应下 encoder 模型复兴:一场「BERT 复仇」 — JFPuget · 2026-09-22
- 哲学家访谈:首个有意识的 AI 或「跳跃」至复杂意识 — eschwitz · 2026-09-22
- 人类视频成机器人预训练底座:有效经验=小时数×每小时信息密度 — rohanpaul_ai · 2026-09-22