Meta新论文:小模型实验靠谱吗?超参调优才是Scaling Law缺失钥匙
giffmana · x · 2026-09-22
giffmana 解读 Meta 研究者(含 Kyunghyun Cho、Karen Ullrich 等)的论文《Small-Scale Experiments: Are We There Yet?》(arXiv:2608.11859)。
- Scaling Law 曾承诺低成本的小规模实验,但六年后研究者发现它们在小模型(4M 参数起)上不可靠,于是转向结论「大模型不可避免」。
- 本文指出真正的混淆因素是超参数:小模型对超参极度敏感,而敏感性随规模增大而消退;Scaling Law 只在充分调优的前沿上出现,而达到该前沿需要远超常规的搜索量。
- 消融显示调好超参比任何其他因素都重要;随规模增大,超参损失曲面的维度降低,超参更容易找。
- 但小模型外推仍受统计限制,需要整体性方法。作者据此提出一套以模型为中心的研究方法,并用「pre-norm vs post-norm 该放哪」这个曾耗时多年才定论的问题做演示,从小规模实验中恢复出大规模结论:模型越大 pre-normalization 越好。
- giffmana 对论文中 pre-norm/post-norm 的两种拟合方式(是否绑定不可约误差项)表示有些奇怪。
所属事件:FAIR与NYU论文将缩放律推至4M参数,超参调优成小模型实验关键(7 条相关)→
「研究」频道最新
- RL 训练大量算力花在 grader 上,跑 30 步值得重新 prefill 吗 — stochasticchasm · 2026-09-22
- Diag2Diag:AI 反哺硬件,生成传感器测不出的数据 — AnneliesGamble · 2026-09-22
- 通宵训练类 JEV 模型,120 道难题仅得 24% 分 — BLUECOW009 · 2026-09-22
- 技术评论:某 RL 训练弃用 PipelineRL 保留 KV cache,改用重新 prefill — stochasticchasm · 2026-09-22
- 心理学新论文:用社会身份理论解释 AI 时代的错误信念 — steverathje2 · 2026-09-22
- 从 Adam 转向 Muon 中期训练?业界热议预训练优化器切换与 mxfp4 QAT — stochasticchasm · 2026-09-22