非因果训练的数据效率代价:一条解释扩散模型难训的算术

ThePremiseOfIt · x · 2026-09-11

ThePremiseOfIt 详细解释为什么非因果(non-causal)训练很难:自回归把长度 T 的每个上下文变成 T 个输入-输出对,训练随总 token 数扩展;非因果训练每个上下文只得到一对,效率低得多。这是扩散模型数据效率低、难以训练的原因之一,也是 block diffusion 去年走红的原因——它至少能产出 T//n 个对,代价是生成长度受限于 n。

他同时在回应中猜测:DeepSeek V4.1 架构本可以做成非因果编码器+解码器(只在解码 token 上训练,保持因果性),那样可能成为更强的 reasoner。作者称克服这一数据效率问题正是其公司 Premise 在做的工作。这是一条有实质架构洞察的技术长回复。

所属事件:自回归与扩散模型训练效率之争再起(4 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →