HC-DLM:分层连续扩散语言模型,离散 token 与连续潜轨迹耦合去噪
UIUC-CS · hf · 2026-10-02
论文提出分层连续扩散语言模型(HC-DLM),针对两类扩散语言模型的结构瓶颈:
- 离散扩散并行解码时各 token 独立于边缘分布采样,切断同步解码 token 间的统计依赖;
- 连续扩散的去噪器只见连续状态,直到最终解码前都与有效 token 配置脱钩。
HC-DLM 在单一有原则的去噪过程中耦合离散 token 生成与连续潜在轨迹,训练目标由 token 似然的变分界导出;潜变量是唯一持久的生成状态,每步从它读出 token 并反馈为下一轮潜变量更新的支架。在结构化推理(Sudoku)、数学规划(Countdown)与语言建模(LM1B)上,同尺寸下谜题准确率与生成困惑度均优于离散与连续扩散基线。项目页:hc-dlm.github.io。
「研究」频道最新
- 研究:用更小模型生成 rejected 样本,7B-72B 学生模型训练效果反而更强 — LinkedIn · 2026-10-02
- HIDE 基准揭示:机器人操作策略普遍缺乏部分可观测下的记忆能力 — Yansong Shi · 2026-10-02
- InterEvolve:用测试时奖励程序进化让人形机器人零重训学新任务 — UIUC-CS · 2026-10-02
- USC 提出 HeteroFold:跨模型家族 KV 缓存免预填充传输,32K 上下文快 10.7 倍 — UniversityofSouthernCalifornia · 2026-10-02
- Nature 封面:630 万核测序绘制人类前额叶最大基因活动图谱 — jiqizhixin · 2026-10-02
- 1.3微秒CPU检测幻觉:120B大模型反而集体自信胡编 — More_Slide5739 · 2026-10-02