MultiMDM:让掩码扩散语言模型「先打草稿」实现少步生成
QuanquanGu · x · 2026-09-05
UCLA 团队(含 Quanquan Gu、Lexing Ying)在 COLM 2026 发表论文 MultiMDM,解决掩码扩散语言模型(MDM)难以少步生成的问题:MDM 所有前向轨迹都坍缩到同一全掩码态,缺乏 consistency 少步生成所需的终端熵。
核心思路:
- 保留掩码结构:前向过程先把每个干净 token 推向指定的 mask,再在 mask 集合间逐渐混合
- 反向过程因此获得「打草稿」能力——先预测目标 mask,再精炼为干净 token,即让 [MASK] 携带该词的粗略计划
- 给出闭式 ELBO 训练目标,可从预训练 MDM 持续训练
- 提出纯离散态的 consistency 蒸馏方案,用 shared-Gumbel coupling 降低路径熵
预训练与蒸馏实验均表明 MultiMDM 是有原则的少步生成的有效基础。
「研究」频道最新
- VeriPhy:用类型化物理义务对世界模型生成视频做可审计验证 — Wenzhuo Xu · 2026-09-05
- LoRA 作者发博文详解开源模型后训练与 RL 实操 — iamrobotbear · 2026-09-05
- CoT 监控热议下,一视频带你窥探 LLM 内部思维过程 — kastnerkyle · 2026-09-05
- 多智能体辩论可能越辩越错,ICML 论文揭示讨好型失败模式 — ghadfield · 2026-09-05
- 「我们困在巨大的局部最优」:一张旧图引发的 ML 范式讨论 — ZeeshanZiaML · 2026-09-05
- AI 数学证明系统如何工作?Reddit 拆解 Lean 验证流水线设计 — tough-dance · 2026-09-05