Sander Dieleman 长文:连续扩散语言模型为何卷土重来
LucaAmb · x · 2026-10-06
DeepMind 研究员 Sander Dieleman 发布约 44 分钟阅读的长文,梳理连续扩散语言模型(continuous diffusion LM)在沉寂数年后重新崛起的迹象与原因,回应自回归范式的长期主导地位。
核心内容:
- 背景:现代 LLM 几乎全是自回归模型,逐 token 生成;但自回归并非序列迭代生成的唯一方式,早期受音视频扩散启发的研究曾尝试把扩散用于语言
- 此前全离散扩散方法一度取代了连续扩散的尝试,如今风向转变,近期研究密集涌现
- 触发点之一是 Sigma:首个大规模(3B/8B)以似然训练的连续扩散 LM,在数学和编码上与离散扩散及自回归模型相当,并支持有意义的推理时干预研究
- 文章后半部分讨论连续扩散用于语言的技术细节,作者强调这是主观视角,欢迎异见
「模型」频道最新
- Julien Simon:「Kolibri 是欧洲 DeepSeek 时刻」是集体误读 — julsimon · 2026-10-06
- Opus 5.5 很强但仍要逼着干活,网友吐槽新模型攀比式吹捧 — haider1 · 2026-10-06
- 扎克伯格复盘:Llama 4 失败因照 Instagram 模式堆人 — rohanpaul_ai · 2026-10-06
- 受控实验比较 token、字节与像素编码:没有一种编码全面占优 — delliott · 2026-10-06
- 「gpt-next」旧代号再被提及,爆料者猜测 OpenAI 新模型藏彩蛋 — RileyRalmuto · 2026-10-06
- 限额机制对比:Claude 烧光单模型额度还剩 50%,OpenAI 直接归零 — xiaohu · 2026-10-06