新训练配方宣称比标准 scaling 省 5.17 倍数据
inductionheads · x · 2026-07-21
这条转述的是一项关于 LLM 训练配方 的研究:当算力继续增长、数据却越来越紧张时,传统 scaling recipe 可能已经不够省数据。
原文给出的两个关键发现是:
- 在 2 亿 token 的预算下,把 weight decay 提到常规 0.1 的约 30 倍,比标准配置更有效;
- 在总参数量相同的前提下,训练一个 模型集成(ensemble) 往往优于单个更大的模型。
研究者基于 Chinchilla 式 scaling law 进一步推算:如果同时激进地放大单模型规模和集成规模,最终配方在相近效果下可实现 5.17 倍的数据效率提升。配图展示了标准 recipe、正则化 recipe、集成 recipe 以及联合 scaling recipe 的对比,联合策略的数据效率最好。
「研究」频道最新
- Skyfall GS 登场:用 Flux 提升 Gaussian Splatting 精修质量 — ducha_aiki · 2026-09-11
- 一万个智能体能否突破反向传播,找到更好的学习算法 — SeunghyunSEO7 · 2026-09-11
- Apodex 发布 TRACES 标准:用 423 个真实问题评测"发现型 AI" — Faheem_uh · 2026-09-11
- 科学没有标准答案:TRACES 用六维度评估 AI 过程而非结果 — Faheem_uh · 2026-09-11
- Apodex 推出 TRACES 基准:不打标准答案,专测 AI 探索未知的能力 — Faheem_uh · 2026-09-11
- Cognition SWE-2 用 KKT 对偶优化长度惩罚,一次 RL 推移 Pareto 曲线 — YouJiacheng · 2026-09-11