扩散模型真的更省数据吗?两条训练效率账被摊开算
mgostIH · x · 2026-09-11
ThePremiseOfIt 指出自回归训练的根本优势:长度 T 的上下文可拆成 T 个输入-输出对,所以训练效率随总 token 数而非总上下文数扩展;非因果(non-causal)训练每个上下文只产出一个输入-输出对,数据效率显著更低——这正是扩散模型难训练、而 block diffusion 去年流行的原因(它能产出 T/n 个对,但生成长度受限 n)。
mgostIH 回应称,扩散模型其实有论文支持更省数据:假设序列前后缀均匀随机切分,预训练阶段平均只需约一半 token。两人在非因果架构(如 DeepSeek V4.1 是否本可做非因果编码器+解码器)的数据效率代价上展开了有技术含量的讨论,Premise 团队称这正他们在做的工作。
「研究」频道最新
- NVIDIA 开源 BioNeMo 推理运行时,GPU 加速蛋白质结构预测 — AllThingsApx · 2026-09-12
- ApprenticeBench:Agent 真实岗位持续学习已超越人类专家 — ysu_nlp · 2026-09-12
- Greenblatt 谈 RL 环境为何 2026 比 2024 更有效 — dejavucoder · 2026-09-12
- EvoHarnessBench:给 Agent 不断加工具,反而可能让它变差 — mohitban47 · 2026-09-11
- Owain Evans:人类用几百年把数学形式化,AI 接棒走完剩余路程 — brianryhuang · 2026-09-11
- 基于 Parakeet 的开源 ASR 新模型 Orukeet:74 项测试 61 项超原版 — arturdent · 2026-09-11