Dwarkesh 实验显示预训练进步四分之三来自数据
Dwarkesh Patel 与合作者用 2019-2025 年各年度代表性的开源模型配方和数据语料,在多个小规模上做预训练组合实验,拆解六年来的预训练进步来源。结果显示:数据改进贡献的算力乘数约为模型侧的 3.24 倍,即预训练进步中约四分之三来自数据而非架构等模型改进;具体而言,数据改进带来约 12 倍算力收益,模型改进仅约 3.7 倍。
2026-09-09 ~ 2026-09-09 · 3 条相关
- 实测拆解 6 年预训练进步:数据贡献 12 倍算力收益,模型仅 3.7 倍 — sebkrier · 2026-09-09
- Dwarkesh 预训练复现实验:数据改进贡献算力增益是模型侧 3.24 倍 — josh_wills · 2026-09-09
- Dwarkesh 实验:预训练进步 3/4 来自数据而非架构改进 — eliebakouch · 2026-09-09