CDM:离散扩散模型奖励引导采样提速 50 倍,计算开销不足 5%

CatAstro_Piyush · x · 2026-08-28

KAIST、密歇根大学与 NVIDIA 的论文提出 Contrastive Distribution Matching (CDM):在离散扩散模型中,向奖励倾斜的采样(reward-tilted sampling)通常依赖 Twisted SMC,而估计最优 twist 函数需要昂贵的蒙特卡洛近似,造成推理瓶颈。

CDM 通过正负样本对比学习一个参数化 twist 函数,把每步 twist 评估降为常数时间操作,计算开销相比基础模型单次前向传播增加不到 5%,同时比 Twisted SMC 快最多 50 倍。训练上利用离散扩散闭式前向核重构梯度估计器。

实验显示 CDM 在相同 wall-clock 时间下一致超过现有基线,应用覆盖毒性文本生成、调控 DNA 序列设计、蛋白质可设计性以及扩散大语言模型对齐。论文与代码已开源。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →