Varun Neal:文本扩散模型将成为 LLM 推理的未来

akbirthko · x · 2026-10-02

Varun Neal 发表长文《Diffusion will be everywhere》,论证文本扩散模型将快速普及:

核心主张:相比自回归模型,文本扩散在推理效率、test-time scaling 和 RL 上有优势;且将强 AR 模型转换为扩散模型的成本已经很低,任何拥有优质 AR checkpoint 的实验室都能采用。

工作原理:扩散生成从随机 token 画布开始,每一步对整个序列同时预测,只提交最有把握的位置,逐步「去噪」直至全部落定。因此生成 P 个 token 只需 K 次前向传播(K≪P):如 DiffusionGemma 生成 256 token 画布最多 48 步去噪,自适应停止平均约 12 步。

算力权衡:扩散多花 K 倍计算,但把内存读取减少到 P/K。由于 GPU 上从显存搬运字节的耗时是运算的数百倍,当解码瓶颈在内存读取时,这笔交换是划算的。

作者判断随着转换流程成熟,扩散将迅速渗透整个 LLM 生态。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →