FAIR与NYU论文将缩放律推至4M参数,超参调优成小模型实验关键
FAIR 与 NYU 研究者(含 Kyunghyun Cho、Karen Ullrich 等)发表论文《Small-Scale Experiments: Are We There Yet?》(arXiv:2608.11859),研究缩放律在不破坏拟合与可预测性的前提下能向小模型一端推到多小、需要什么条件。博主 giffmana 逐条拆读论文要点:论文成功训练了低至 4M 参数的模型,并得到看起来合理的缩放律拟合。
已确认
- 论文的关键发现是模型越小,调「无聊」超参越重要:用随机搜索调参时,每尺度只取 4 组超参的最优值去拟合缩放律会得到荒谬结果(BPC loss >2),而每尺度跑 256 组后拟合明显变好。
- 由于模型极小,每尺度 256 次随机搜索的成本其实不高;但 giffmana 提醒,随机搜索次数只有在说明采样域时才有意义,并指出论文采样的 lr 范围偏宽,其余超参(AdamW、WSD 调度)看起来合理。
- 论文还讨论了有效参数计数方式、pre-norm vs post-norm 等要点。
- 此外,giffmana(Lucas Beyer)吐槽论文文风「有一种诡异的气质」:部分段落完全正常,另一些段落则充满典型的 LLM 味(slop),整体呈现奇怪的人机混合文风,但他仍推荐读者阅读。
尚未确认
- giffmana 指出论文没有说明拟合缩放律时如何选择数据点,而从图上看 4M 模型的最后一个点明显偏离拟合线,说明选点方式可能影响结论。
为什么重要
- 基于随机搜索结果的分布,论文得出令 giffmana 意外的反直觉结论:模型规模越大越容易找到好超参,而在最小尺度上找好超参非常困难。giffmana 认为这需要限定:它并不意味着训练随规模变大更简单——超过论文实验范围后不稳定问题会越来越多;它真正说明的是大约 64M 以下的小模型实验需要密集的超参调优,超参调优可能是过去小模型缩放律实验不靠谱的缺失钥匙。这对依赖小模型实验做缩放律预测的研究者具有直接的方法论意义。
2026-09-22 ~ 2026-09-22 · 7 条相关
一手来源
- Meta新论文:小模型实验靠谱吗?超参调优才是Scaling Law缺失钥匙 — giffmana ·
- 缩放律小模型端:每尺度需256次随机搜索才得良好拟合 — giffmana ·
- 缩放律做到4M参数仍有良好拟合,但选点方法存疑 — giffmana ·
- FAIR与NYU论文把缩放律推到4M参数,超参调优成关键 — giffmana · 2026-09-22
- 【源头】缩放律做到4M参数仍有良好拟合,但选点方法存疑 — giffmana · 2026-09-22
- 【源头】缩放律小模型端:每尺度需256次随机搜索才得良好拟合 — giffmana · 2026-09-22
- 模型足够小,每尺度256次随机搜索其实很便宜 — giffmana · 2026-09-22
- 反直觉结论:规模越大越好找好超参,64M以下需密集调优 — giffmana · 2026-09-22
- 【源头】Meta新论文:小模型实验靠谱吗?超参调优才是Scaling Law缺失钥匙 — giffmana · 2026-09-22
- Lucas Beyer 吐槽新论文文风:部分段落明显像 LLM 代写 — giffmana · 2026-09-22