新 scaling law 发现:部分规模下重复训练胜过改写
burny_tech · x · 2026-07-29
这篇新论文提出一套 Compute-Data(CD)scaling laws,试图把传统的 compute-optimal 和 data-optimal 预训练规律统一起来。
- 论文指出,经典 scaling law 默认“新鲜训练数据无限供应”,但现实里高质量数据越来越稀缺,预训练正进入数据受限时代。
- 作者引入一个 token-effectiveness function η,用来衡量“派生 token”(例如多轮重复、改写后的数据)相对于新鲜 token 的有效性。
- 他们在 Dolma-3 上做了实验,模型规模覆盖 14M 到 600M 参数,比较了两种数据扩展方式:
- 多 epoch 重复训练
- paraphrasing(改写)
- 主要结论是:
- 派生数据的有效性不是常数,会同时受模型大小、tokens-per-parameter 比例和派生数据量影响;
- 随着语料扩张,token 有效性会饱和;
- 用更多算力替代更多数据的收益会递减;
- 在大多数实际场景里,传统 compute-optimal 分配已经不再最优。
- 论文把训练分成 compute-bound、data-bound、model-bound 三种状态,并指出在某些模型规模与语料范围里,重复训练可能比改写更划算。
「Infra」频道最新
- 上海 Aishengna 被指接手 DUV 光刻设备制造 — zephyr_z9 · 2026-07-29
- 跨厂商 Vulkan 后端把端侧推理从 30ms 压到 3ms — ppchaos · 2026-07-29
- pdf-mcp 把技术 PDF 转成结构化文本和可搜索图像 — tom_doerr · 2026-07-29
- Moonshot 发布 2.8T 开源 Kimi K3,支持 100 万 token 上下文 — alex_verem · 2026-07-29
- SK hynix 日内巨震,HBM 盈利能力继续上行 — basedjensen · 2026-07-29
- WeCommerce 用 Weaviate 做氛围搜索,商品不靠关键词也能找 — victorialslocum · 2026-07-29