用表示空间 MMD 后训练扩散语言模型,16B 模型解码更并行

yresearch · hf · 2026-10-06

yresearch 提出一种针对扩散语言模型(DLM)的后训练方法:在冻结的预训练 DLM 特征空间中最小化生成分布与参考分布之间的最大均值差异(MMD)。通过保留单个 token 位置上的上下文特征,一次特征提取即可获得每序列多个观测点。

优化方式上,离散模型使用策略梯度,连续模型直接对生成的 latent 求微分——无需完整采样轨迹或联合训练的辅助模型,即可高效完成后训练。

实验显示:在 OpenWebText 上同等熵水平下生成困惑度更低;GSM8K 上精度-算力权衡更优;在 16B 的 DMax-LLaDA2.0(混合 masked-uniform 扩散)上,可在数学与代码基准精度持平或更高的情况下提高解码并行度。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →