新训练配方宣称比标准 scaling 省 5.17 倍数据
inductionheads · x · 2026-07-21
这条转述的是一项关于 LLM 训练配方 的研究:当算力继续增长、数据却越来越紧张时,传统 scaling recipe 可能已经不够省数据。
原文给出的两个关键发现是:
- 在 2 亿 token 的预算下,把 weight decay 提到常规 0.1 的约 30 倍,比标准配置更有效;
- 在总参数量相同的前提下,训练一个 模型集成(ensemble) 往往优于单个更大的模型。
研究者基于 Chinchilla 式 scaling law 进一步推算:如果同时激进地放大单模型规模和集成规模,最终配方在相近效果下可实现 5.17 倍的数据效率提升。配图展示了标准 recipe、正则化 recipe、集成 recipe 以及联合 scaling recipe 的对比,联合策略的数据效率最好。
「研究」频道最新
- LFM2 扩容 tokenizer 后,泰语 token 减少 4 倍 — maximelabonne · 2026-07-21
- Argus 用协同可见性与几何 Transformer 提升室内 3D 重建 — ducha_aiki · 2026-07-21
- WAIC 机器人正进入可商业化成功率阶段 — chris_j_paxton · 2026-07-21
- Unitree 用自家 G1 集群上线真实机器人远程评测 — chris_j_paxton · 2026-07-21
- 给 VLM 加顺序元数据后,错误检测会崩掉 — m_wulfmeier · 2026-07-21
- 新提示模板提升空间推理,并减少模型偷懒输出 — legit_api · 2026-07-21