数据受限时扩散模型胜过自回归,arXiv 论文给出新 scaling law
mgostIH · x · 2026-09-11
mgostIH 在讨论中指出扩散语言模型数据效率更高,并引用 CMU 团队论文《Diffusion Beats Autoregressive in Data-Constrained Settings》(arXiv:2507.15857)。论文要点:
- 核心发现:在算力充足但数据稀缺、需对有限数据重复训练的场景下,masked diffusion 模型显著优于自回归(AR)模型,验证损失更低、下游性能更好。
- 新 scaling law:作者推导出扩散模型的新 scaling 规律,并给出临界算力阈值的闭式表达式,超过该阈值后扩散开始胜过 AR。
- 机理解释:扩散模型的随机掩码目标隐式地在丰富的 token 顺序分布上训练,相当于隐式数据增强,而 AR 固定的从左到右分解缺乏这种性质。
- 结论:当瓶颈在数据而非算力时,扩散范式是 AR 的有力替代。代码已开源。
「研究」频道最新
- DDD 基准:GPT-6 Astra 成逆合成规划最强的通用前沿模型 — CatAstro_Piyush · 2026-09-12
- Schulman 等前沿研究员长谈:蒸馏是对抗算力集中化的关键力量 — himanshustwts · 2026-09-12
- 数学会议谈 AI 与数学共生,演讲幻灯片已公开 — kuchaev · 2026-09-12
- UC Berkeley 教授七年讲义成书:490 页因果推断教材免费开放 — udmrzn · 2026-09-12
- 「他们在折磨仿真果蝇大脑,你们居然在笑」刷屏 — VoidStateKate · 2026-09-12
- AI 持久记忆仍是状态管理难题:检索之外还要维护演化中的知识状态 — Raza2614 · 2026-09-12