Google 开源 PreviewDiff:多模态 critic 引导扩散采样中途纠偏
google · hf · 2026-10-01
Google 发布 PreviewDiff,一种免训练的测试时搜索方法,把扩散采样从 Best-of-N 的标量搜索变成由多模态 critic 引导的搜索。
- 核心思路:在选定的去噪检查点解码部分预览图,让多模态评审模型打分并给出自然语言批评,再用这些反馈在语义 prompt 修改和局部加噪的 latent 延续上分支,边生成边筛选——样本仍可编辑时就把 verifier 算力投进去,而非等生成完再挑选。
- 动机:扩散模型在物体数量、属性绑定、空间关系、时序动作等组合性细节上常翻车,Best-of-N 只能事后选、无法挽救失败的轨迹。
- 结果:在图像和视频生成基准上,PreviewDiff 一致优于同等算力的 Best-of-N 及强标量搜索基线;消融显示越早干预、搜索宽度越大收益越高。
展示了多模态反馈不只可当最终验证器,更可作去噪过程中的主动控制器。
「多模态」频道最新
- Runway 团队专访:谈实时模型、生成式界面与机器人下一步 — runwayml · 2026-10-01
- NVIDIA 发布 LongLive-Plug:一次蒸馏 LoRA 即插即用于 54 个视频模型 — _akhaliq · 2026-10-01
- 用户用 Opus 5.5 生成 p(doom) 主题音乐视频回应争论 — LilijoySkySeeker · 2026-10-01
- Tesseract 插件让 ChatGPT/Claude 对话内直接做设计与动效 — aziz4ai · 2026-10-01
- SeedVR2 视频超分插件更新:6GB 显存也能跑 TensorRT 全流程 — simmol · 2026-10-01
- 评论人:大公司消解音乐语境,'个人 AI 音乐'是疏离的产物 — pixlpa · 2026-10-01