连续扩散语言模型卷土重来,Sander Dieleman 长文梳理复兴脉络
joao_gante · x · 2026-08-24
Sander Dieleman 发布约 44 分钟阅读量的长文《Continuous diffusion language models》。他指出:语言建模长期由自回归范式主导——逐 token 生成、teacher forcing 带来高效并行训练、可扩展性极强,造就了如今的 LLM。但扩散模型提供了另一种迭代生成路径:受音频/图像领域早期成功启发,研究者曾尝试将其用于语言。
他回顾了这一方向的历史:早期连续扩散做语言的尝试一度被离散扩散方法取代而沉寂,但今年以来连续扩散语言模型研究再度升温,出现大量新工作,暗示该路线正在复兴。文章从历史视角梳理了这波复兴的成因与技术细节,并承认这是较主观的评述,欢迎不同意见讨论。
「模型」频道最新
- 用户称赞 Qwen 3.8 适配硬件广泛且性能全能 — uwukko · 2026-08-24
- Laguna XS 2.1:显存不足时的编程模型优选 — needthosepylons · 2026-08-24
- 实测 OX-Alpha 代码能力优于 DeepSeek-V4 — karminski3 · 2026-08-24
- Qwen2.5-72B 登顶 HuggingFace 点赞榜,远超次席 — choose_a_guest · 2026-08-24
- Agnes-AI 在 Hugging Face 发布 Agnes-2.5-Pro-Alpha — External_Mood4719 · 2026-08-24
- 开源 Pelican SVG 环境,量化评估模型画图能力 — SergioPaniego · 2026-08-24