密歇根大学:换更可扩散的嵌入空间,连续扩散语言模型超越 GPT-2-M
umich · hf · 2026-10-02
密歇根大学研究探索连续扩散语言模型(DLM)该用什么嵌入作潜在空间,即哪种嵌入最「可扩散」。
关键发现:
- 同家族内换更强嵌入模型(T5 → T5Gemma-1 → T5Gemma-2)显著提升生成性能;
- 但 T5Gemma-2 原始嵌入区分性过强,连合理替代词的嵌入也彼此分离,采样稍有偏差就落到无效嵌入,生成失败;
- 解法:把 T5Gemma-2 蒸馏给学生编码器,以教师的解码概率作软标签,拉近替代词嵌入同时保留编解码机制,得到更连通的潜在空间。
最终中型 DLM 在 OpenWebText 上取得生成 PPL 17.8(真实文本 PPL 15.4),优于 GPT-2-M。
「研究」频道最新
- Meta 论文:推荐系统训练中仅 50-60% 时间真正在训练 — _reachsumit · 2026-10-02
- OmniSeek:让全模态大模型学会主动“看与听”检索证据 — Haibo Wang · 2026-10-02
- Netflix 发布口型同步裁判 ATR,七语言基准 AUC 提升 50%+ — netflix · 2026-10-02
- 北大 DexPolicy:探索噪声退火让灵巧手操作成功率升至 85% — PekingUniversity · 2026-10-02
- 微软 ActiveSaddler:自动课程学习让 Agent harness 提升 7.5 个百分点 — microsoft · 2026-10-02
- 阿里提出 PoS:显式信念状态治「信念陷阱」,四个基准全面领先 — alibabagroup · 2026-10-02