用表示空间 MMD 后训练扩散语言模型,16B 模型解码更并行
yresearch · hf · 2026-10-06
yresearch 提出一种针对扩散语言模型(DLM)的后训练方法:在冻结的预训练 DLM 特征空间中最小化生成分布与参考分布之间的最大均值差异(MMD)。通过保留单个 token 位置上的上下文特征,一次特征提取即可获得每序列多个观测点。
优化方式上,离散模型使用策略梯度,连续模型直接对生成的 latent 求微分——无需完整采样轨迹或联合训练的辅助模型,即可高效完成后训练。
实验显示:在 OpenWebText 上同等熵水平下生成困惑度更低;GSM8K 上精度-算力权衡更优;在 16B 的 DMax-LLaDA2.0(混合 masked-uniform 扩散)上,可在数学与代码基准精度持平或更高的情况下提高解码并行度。
「研究」频道最新
- Sander Dieleman 长文:连续扩散语言模型为何卷土重来 — LucaAmb · 2026-10-06
- 审计 7 款 LLM 评测工具源码,发现 13 处打分与实际检查不符 — maverick_man1111 · 2026-10-06
- 为修评测而生的 Terminal-Bench Pro:8 领域 400 任务零污染 — thisguyknowsai · 2026-10-06
- ROME 训练管线拆解:500B token CPT 加两阶段 SFT 与 RL — thisguyknowsai · 2026-10-06
- ROME 提出 IPA:按块而非按 token 分配 RL 信用 — thisguyknowsai · 2026-10-06
- ROME 模型先行搭建 ROLL/ROCK/iFlow 全套智能体基础设施 — thisguyknowsai · 2026-10-06