扩散语言模型可解释性研究揭示非时序推理等新现象

一篇针对 DiffusionGemma 的可解释性案例研究论文发布,作者通过一系列案例分析初步发现多种扩散模型特有的新现象,包括非时序推理与 token 涂抹现象。研究将扩散大语言模型的透明度分解为变量透明度与算法透明度两个维度,指出 DiffusionGemma 初看似乎在连续潜在空间中运作,为理解扩散语言模型的推理机制提供了新视角。

2026-08-28 ~ 2026-08-28 · 2 条相关