自回归与扩散模型训练效率之争再起
ThePremiseOfIt 摊开两条训练效率账:自回归训练可将长度 T 的上下文拆成 T 个输入-输出对,效率随总 token 数扩展,而非因果训练存在数据效率代价,这解释了扩散模型难训的原因。开发者 mgostIH 复盘称 DeepSeek V4.1 本可采用非因果编码器加解码器组合成为更强推理器,实际却选择全因果设计;他还引用 CMU 论文《Diffusion Beats Autoregressive in Data-Constrained…》,指出数据受限时扩散语言模型优于自回归,并获得新的 scaling law。
2026-09-11 ~ 2026-09-11 · 4 条相关
- 网友复盘 DeepSeek V4.1 架构:若用非因果编码器或可成更强推理器 — mgostIH · 2026-09-11
- 非因果训练的数据效率代价:一条解释扩散模型难训的算术 — ThePremiseOfIt · 2026-09-11
- 扩散模型真的更省数据吗?两条训练效率账被摊开算 — mgostIH · 2026-09-11
- 数据受限时扩散模型胜过自回归,arXiv 论文给出新 scaling law — mgostIH · 2026-09-11