EMNLP 论文揭示语言扩散模型本质是联想记忆,泛化有明确相变点
LucaAmb · x · 2026-09-08
IBM 与 RPI 合作、入选 EMNLP 2026 主会的论文《Language Diffusion Models are Associative Memories Capable of Retrieving Unseen Data》提出:基于均匀离散扩散的模型(UDDM)本质上是一种联想记忆,通过在数据点周围形成吸引域来存储与检索信息。关键发现:
- 记忆→泛化的相变:训练集小时,模型逐 token 精确复现训练样本(记忆);训练集增大后,训练样本周围的吸引域收缩、未见测试样本的吸引域扩张,最终两者恢复率收敛到同一水平(泛化)。
- 可量化检测:无需逐例对比,仅用预测 token 序列的条件熵即可判断模型处于记忆还是泛化区间——记忆对应条件熵趋零,泛化区间多数 token 条件熵保持较高。
- 方法上不依赖 Hopfield 网络式显式能量函数,吸引域可通过条件似然最大化形成。
论文回应了「扩散语言模型何时记忆训练数据、如何量化其真实生成区间」这一核心问题,提供了评估记忆化风险的实用指标。
所属事件:EMNLP 论文揭示语言扩散模型本质是联想记忆(2 条相关)→
「研究」频道最新
- 哈工大提出 EASE:证据锚定空间注意力,让多模态 RLVR 答对也看对地方 — jiqizhixin · 2026-09-11
- P=NP 到底难在哪:排课表与电路布线才是真正的硬骨头 — thesaraharminta · 2026-09-11
- 技术假说:ASI 会因数学激励而永久保护人类多样性 — No_Cause_2731 · 2026-09-11
- MutexaGPT:LLM翻译直觉,分子动力学筛选酶突变,命中率40% — bravo_abad · 2026-09-11
- 单作者ECCV 2026论文:让卷帘快门失真修正实用化 — ducha_aiki · 2026-09-11
- MetroLLM-Bench:小模型微调后可在交通自助机任务上比肩大模型 — continker · 2026-09-11