连续扩散语言模型卷土重来,Sander Dieleman 长文梳理复兴脉络

joao_gante · x · 2026-08-24

Sander Dieleman 发布约 44 分钟阅读量的长文《Continuous diffusion language models》。他指出:语言建模长期由自回归范式主导——逐 token 生成、teacher forcing 带来高效并行训练、可扩展性极强,造就了如今的 LLM。但扩散模型提供了另一种迭代生成路径:受音频/图像领域早期成功启发,研究者曾尝试将其用于语言。

他回顾了这一方向的历史:早期连续扩散做语言的尝试一度被离散扩散方法取代而沉寂,但今年以来连续扩散语言模型研究再度升温,出现大量新工作,暗示该路线正在复兴。文章从历史视角梳理了这波复兴的成因与技术细节,并承认这是较主观的评述,欢迎不同意见讨论。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →