扩散模型真的更省数据吗?两条训练效率账被摊开算

mgostIH · x · 2026-09-11

ThePremiseOfIt 指出自回归训练的根本优势:长度 T 的上下文可拆成 T 个输入-输出对,所以训练效率随总 token 数而非总上下文数扩展;非因果(non-causal)训练每个上下文只产出一个输入-输出对,数据效率显著更低——这正是扩散模型难训练、而 block diffusion 去年流行的原因(它能产出 T/n 个对,但生成长度受限 n)。

mgostIH 回应称,扩散模型其实有论文支持更省数据:假设序列前后缀均匀随机切分,预训练阶段平均只需约一半 token。两人在非因果架构(如 DeepSeek V4.1 是否本可做非因果编码器+解码器)的数据效率代价上展开了有技术含量的讨论,Premise 团队称这正他们在做的工作。

所属事件:扩散与自回归模型数据效率之争再起(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →