Varun Neal:文本扩散模型将成为 LLM 推理的未来
akbirthko · x · 2026-10-02
Varun Neal 发表长文《Diffusion will be everywhere》,论证文本扩散模型将快速普及:
核心主张:相比自回归模型,文本扩散在推理效率、test-time scaling 和 RL 上有优势;且将强 AR 模型转换为扩散模型的成本已经很低,任何拥有优质 AR checkpoint 的实验室都能采用。
工作原理:扩散生成从随机 token 画布开始,每一步对整个序列同时预测,只提交最有把握的位置,逐步「去噪」直至全部落定。因此生成 P 个 token 只需 K 次前向传播(K≪P):如 DiffusionGemma 生成 256 token 画布最多 48 步去噪,自适应停止平均约 12 步。
算力权衡:扩散多花 K 倍计算,但把内存读取减少到 P/K。由于 GPU 上从显存搬运字节的耗时是运算的数百倍,当解码瓶颈在内存读取时,这笔交换是划算的。
作者判断随着转换流程成熟,扩散将迅速渗透整个 LLM 生态。
「模型」频道最新
- 9 月本地模型盘点:27B 塞进 5.9GB、手机级 35B 等数十款发布 — vramkickedin · 2026-10-02
- 用户实践:Gemini 新模型跑通宵开放式任务,日常交给 Flash — JMateosGarcia · 2026-10-02
- 爆料称 Google 内部已有比 Argon 更强的模型(未证实) — Independent-Wind4462 · 2026-10-02
- Chollet:base 模型零流体智力,ARC 1 扩容 10 万倍仅到 10% — fchollet · 2026-10-02
- 用户实测:ChatGPT 聊天对话也在悄悄扣 Codex 额度,与官方文档相反 — jonistaken · 2026-10-02
- Grok 4.7 开始在网页与移动端推送,覆盖 Fast/Expert/Build/Heavy 全模式 — testingcatalog · 2026-10-02