CDM:离散扩散模型奖励引导采样提速 50 倍,计算开销不足 5%
CatAstro_Piyush · x · 2026-08-28
KAIST、密歇根大学与 NVIDIA 的论文提出 Contrastive Distribution Matching (CDM):在离散扩散模型中,向奖励倾斜的采样(reward-tilted sampling)通常依赖 Twisted SMC,而估计最优 twist 函数需要昂贵的蒙特卡洛近似,造成推理瓶颈。
CDM 通过正负样本对比学习一个参数化 twist 函数,把每步 twist 评估降为常数时间操作,计算开销相比基础模型单次前向传播增加不到 5%,同时比 Twisted SMC 快最多 50 倍。训练上利用离散扩散闭式前向核重构梯度估计器。
实验显示 CDM 在相同 wall-clock 时间下一致超过现有基线,应用覆盖毒性文本生成、调控 DNA 序列设计、蛋白质可设计性以及扩散大语言模型对齐。论文与代码已开源。
「研究」频道最新
- 新研究用修饰 tRNA 救治囊性纤维化无义突变 — anshulkundaje · 2026-08-28
- vLLM 深度测评:MTP、EAGLE 等 5 种推测解码在 AMD 显卡上的实战表现 — vllm_project · 2026-08-28
- 11 年机器人进化对比:量产与全身 RL 控制是关键 — chris_j_paxton · 2026-08-28
- Agent-Core 规范:定义智能体的内核安全与任务合约机制 — BLUECOW009 · 2026-08-28
- 谷歌开源 SAM:主权智能体网络框架 — adnan_hashmi · 2026-08-28
- Marin 535B-A23B 训练进度 7%,团队将分享设计决策与权衡 — bariskasikci · 2026-08-28