PreviewDiff: Multimodal Critic-Guided Search over Diffusion Latents
Vighnesh Subramaniam, Boris Katz, Brian Cheung, Chun-Liang Li, Tomas Pfister, Yale Song
cs.CV, cs.AI, cs.LG
2026-09-29
免训练的测试时搜索:在去噪检查点解码预览、多模态 judge 打分加批注,按批注分支续去噪,图像视频基准上稳定超过同算力 Best-of-N。
扩散模型画面足够逼真,卡住的是组合性细节:物体个数数错、「红色的杯子」把颜色染到旁边物体上、左右空间关系画反、视频里动作和时间线对不上。FID、CLIPScore 这类整体指标看不出这些毛病,GenEval 一类针对性评测一测一个准。业界标准补救是测试时多花算力:Best-of-N 采 N 个完整样本,用奖励模型或多模态 judge 挑最好的。这套做法是开环的。judge 只能在成品里做选择,一条中途有希望但已经跑偏的轨迹救不回来,晚失败样本上砸掉的算力全部作废。论文问的问题很直接:同一笔 verifier 调用预算,挪到去噪过程内部去花,是不是更划算?
PreviewDiff 免训练,套在冻结的扩散模型外面,把去噪轨迹变成一棵搜索树,节点是中间去噪状态。
两个设计选择有明确理由。修正以追加注记的方式进行,不重写整条提示词,因为重写容易顺手抹掉已经满足的约束,引入提示词漂移。重噪声化只回退少量采样步,不退回纯噪声,分支因此留在当前场景附近,又保留落实语义修正的余地。树策略用固定宽度 beam 取代 MCTS 常用的访问计数,原因很实际:每次扩展都要解码加一次 judge 调用,没有节点能被反复访问。
整体上这是把 MCTS 的状态、动作、奖励、回传搬进扩散采样,动作空间从无差别的噪声扰动换成了可解释的语义修正。
主缩放实验(平均 Gemini 分,满分 4):SDXL 在 GenEval2 上,预算从 86 涨到 704 步,PreviewDiff 从 2.17 涨到 2.86,同预算 Best-of-N 只从 1.91 到 2.71,所有预算点都落后。视频侧 LTX-Video 在 NarrLV 上是 1.99→2.39 对 1.75→2.13,最大预算处差距 +0.26。
固定预算、跨骨干的对照:
| 设置 | 方法 | 指标 | 结果 |
| SDXL / GenEval2 | PreviewDiff vs Best-of-N | Gemini P@4 | 2.292 vs 2.090 |
| SDXL / GenEval2 | EvoSearch / Particle | Gemini P@4 | 2.103 / 1.902 |
| FLUX.2 9B / GenEval2 | PreviewDiff vs Best-of-N | Gemini P@4 | 3.112 vs 2.775 |
| LTX-Video / NarrLV | PreviewDiff vs Best-of-N | Gemini P@4 | 2.167 vs 1.544 |
| LTX-Video / T2V-CompBench | PreviewDiff vs Video-T1 | Gemini P@4 | 3.021 vs 2.861 |
| Wan 2.2 / VBench 2.0 | PreviewDiff vs Best-of-N | Gemini P@4 | 3.554 vs 3.292 |
换 evaluator 的检验:Qwen-3、BLIP-VQA、LLaVA、Qwen-2.5 各列同步上涨;把搜索内 critic 换成 Qwen-3 也照样有效,不是专挑 Gemini 的偏好优化。人工评估 9 名标注者、360 条图像加 200 条视频提示词,三方偏好 PreviewDiff 占比最高,对 EvoSearch 和 Best-of-N 的两两胜率都显著过半;内容维度提升明显大于风格维度。
消融:搜索宽度是最大杠杆,宽度从 1 到 8,SDXL 从 1.97 拉到 2.74,LTX-Video 从 1.64 到 2.30;树深(1 到 3)和语义变体数(1 到 4)是小幅补充;检查点越早干预越好,预览不需要完美,语义结构可辨认就够用;去掉语言反馈只留打分,图像掉到 2.063、视频掉到 2.014。
test-time scaling 在语言模型侧已是常规操作,视觉生成这边长期停留在 Best-of-N。这篇把 verifier 从终点裁判改成了过程控制器,证明同一笔 judge 预算在中途花比在终点花更有效,而且从 2.5B 到 9B 的底座上都成立,与模型缩放互补。工程上零训练成本,任何暴露中间干净估计的扩散模型都能直接套,对出图准确率敏感、能接受推理加价的场景可以优先试。定位要清楚:这是推理时换质量的方法,收益按 denoiser 步数和 judge 调用数计量;Best-of-N 的样本可全并行,树搜索有串行依赖,实际墙钟差距会比步数差距大不少。
作者自己承认的:critic 只优化提示遵循,风格维度提升弱;动作空间必须保持有限,过早检查点和激进重噪声化会破坏稳定性。读下来还有几处存疑。墙钟延迟全文未报,串行树搜索的真实成本被「按步数匹配预算」的说法盖住了。搜索内 critic 与主评测共用同一个 Gemini 和同款 rubric,GenEval2 考的计数、属性、关系恰好是 critic 被提示去查的错误类型,优化目标和评测标尺部分重合;辅助 evaluator 缓解了这点,但没有消除。提示词编辑消融几乎持平(去掉后 2.292→2.285),与「语义修正是核心」的叙事有张力,真正扛分的是宽度和分支本身;同样去掉语言反馈的两个消融一个掉到 2.063、一个掉到 2.285,论文没解释差异。重启深度消融在方法节提了一句,正文没有给结果。