ANU 团队放出 ECCV'26 扩散模型后训练教程全套幻灯片
CSProfKGD · x · 2026-10-08
澳大利亚国立大学 Liang Zheng 团队公开了 ECCV 2026 半天教程《Aligning Diffusion Models with Human Preferences》的完整幻灯片,系统梳理视觉扩散模型对齐的四大方法家族:
- 直接奖励梯度反传:将奖励梯度沿采样过程反传以对齐模型;
- DPO 式偏好优化:从偏好/拒绝样本对中学习;
- GRPO 在线 RL:采样一组输出,从组内相对奖励学习;
- 前向过程 RL:把对齐目标重构到前向扩散过程上,更接近预训练目标并提升似然估计精度。
每个家族覆盖核心公式、代表方法与优劣分析,并讨论开放挑战。对做视觉生成对齐的研究者是不错的系统性入门材料。
「研究」频道最新
- 港大联合 VAST 推出 Mira-Scene,像素级对齐解决 3D 场景重建错位 — jiqizhixin · 2026-10-08
- 新预印本:几何感知时间重参数化改进 Flow-Map 蒸馏 — FrnkNlsn · 2026-10-08
- Evolvent AI 发布 RSIGym:用「一切皆服务」环境测 AI 自我改进,Opus 5 得 0.48 居首 — cihangxie · 2026-10-08
- Google 三个月 RCT:AI 提升律师产出,新手却学不到判断力 — Dr_Atoosa · 2026-10-08
- 重温 Norvig 名文:统计学习两文化之争,别为优雅理论舍弃真实现象 — 3scorciav · 2026-10-08
- DatologyAI 开源 Zephon:换 GPU 数量不再悄悄扭曲训练实验结果 — lmoroney · 2026-10-08