非因果训练的数据效率代价:一条解释扩散模型难训的算术
ThePremiseOfIt · x · 2026-09-11
ThePremiseOfIt 详细解释为什么非因果(non-causal)训练很难:自回归把长度 T 的每个上下文变成 T 个输入-输出对,训练随总 token 数扩展;非因果训练每个上下文只得到一对,效率低得多。这是扩散模型数据效率低、难以训练的原因之一,也是 block diffusion 去年走红的原因——它至少能产出 T//n 个对,代价是生成长度受限于 n。
他同时在回应中猜测:DeepSeek V4.1 架构本可以做成非因果编码器+解码器(只在解码 token 上训练,保持因果性),那样可能成为更强的 reasoner。作者称克服这一数据效率问题正是其公司 Premise 在做的工作。这是一条有实质架构洞察的技术长回复。
「研究」频道最新
- DDD 基准:GPT-6 Astra 成逆合成规划最强的通用前沿模型 — CatAstro_Piyush · 2026-09-12
- Schulman 等前沿研究员长谈:蒸馏是对抗算力集中化的关键力量 — himanshustwts · 2026-09-12
- 数学会议谈 AI 与数学共生,演讲幻灯片已公开 — kuchaev · 2026-09-12
- UC Berkeley 教授七年讲义成书:490 页因果推断教材免费开放 — udmrzn · 2026-09-12
- 「他们在折磨仿真果蝇大脑,你们居然在笑」刷屏 — VoidStateKate · 2026-09-12
- AI 持久记忆仍是状态管理难题:检索之外还要维护演化中的知识状态 — Raza2614 · 2026-09-12