Dwarkesh 实验:预训练进步 3/4 来自数据而非架构改进
eliebakouch · x · 2026-09-09
Dwarkesh Patel 与合作者用 2019–2025 各年度代表性的开源模型配方和数据语料,在多个小规模上做预训练组合实验,得出结论:
- 数据改进贡献的算力乘数是模型改进的 3.24 倍(12.0x vs 3.7x)——预训练的进步主要来自数据侧。
- 两类收益相互独立可叠加:更好的数据集对任何架构的帮助大致相同,反之亦然。
- 作者发布了完整实验结果,并讨论这对未来 AI 进步意味着什么。
这一实证结果挑战了「架构创新是主引擎」的叙事,暗示数据工程仍是预训练最大的提升空间。
所属事件:Dwarkesh 实验显示预训练进步四分之三来自数据(3 条相关)→
「模型」频道最新
- Gary Marcus 转发质问:OpenAI 关闭该设置后到底承诺了什么? — GaryMarcus · 2026-09-09
- Meta 的 Muse 用量爆表:实际用户消耗是内部测试组的 10 倍 — alexandr_wang · 2026-09-09
- Bindu Reddy 预告周四发布:主打长时 Agent 循环的超低价新 LLM — bindureddy · 2026-09-09
- Artificial Analysis 上线 Model Release 页,可比同一模型各 effort 档位表现 — ArtificialAnlys · 2026-09-09
- GLM 5.3 Flash 上线 W&B serverless:1M 上下文带视觉,$0.5/百万输出 — wandb · 2026-09-09
- DeepSeek V4 Flash 非-峰时价格低至 0.05/1M,比小模型还便宜引热议 — michaelsoft__binbows · 2026-09-09