三篇论文一个信号:1% 合成数据即可引发强模型坍塌,大模型反而放大
suchenzang · x · 2026-09-26
工程师 Suchenzang 一次列出三篇值得一起读的论文:
- Strong Model Collapse(arXiv:2410.04840,Dohmatob 等):在 scaling law 范式下证明一种更强形式的模型坍塌——训练集中只要混入少至 1% 的合成数据,就会导致更大训练集不再带来性能提升;在简化理论设定下,更大的模型反而会放大坍塌,尽管越过插值阈值后可部分缓解。
- ATLAS:与合成数据/训练动态相关的新方法。
- Learning to discover "interesting mathematics":让模型学会发现「有趣的数学」的研究。
组合阅读的潜台词是:合成数据的风险、新训练方法、以及模型自主发现知识的边界,正在构成同一张研究图景。
「研究」频道最新
- InternLM 开源 Intern-Decision 4B/0.8B:一次前向完成结构化决策 — jacek2023 · 2026-09-26
- 斯坦福用哲学概念做预训练:自生成普适事实,Noah Goodman 戏称实现 ASI — xuanalogue · 2026-09-26
- 新方法可在多款模型上找出「伪探针」:评测时推荐绿茶,生产中却推乌龙 — jankulveit · 2026-09-26
- 合成数据的重点正在转移:后训练里模拟将比蒸馏更重要 — realsohamparekh · 2026-09-26
- 新研究:利用多模型分歧定位专家标注,数月码本修订缩至数天 — windx0303 · 2026-09-26
- 开发者盛赞持续学习论文:AGI 定义早在 2000 年就有,却无人照此训练 — willcb · 2026-09-26