缩放律小模型端:每尺度需256次随机搜索才得良好拟合
giffmana · x · 2026-09-22
论文的关键发现:模型越小,调"无聊"超参越重要。用随机搜索调参时,每尺度只取 4 组超参的最优值去拟合缩放律会得到荒谬结果(BPC loss >2),但每尺度跑 256 组后拟合明显变好。作者也指出:论文竟没说明如何选取拟合用的数据点——对 4M 模型,最后一个点明显偏离了拟合线,这对结果可信度有影响。模型最小做到 4M 仍能有不错的拟合。
所属事件:FAIR与NYU论文将缩放律推至4M参数,超参调优成小模型实验关键(7 条相关)→
「研究」频道最新
- Frontier Data Summit 2026 议程曝光:十余个新 benchmark 集中亮相 — dlwh · 2026-09-22
- RL 训练大量算力花在 grader 上,跑 30 步值得重新 prefill 吗 — stochasticchasm · 2026-09-22
- Diag2Diag:AI 反哺硬件,生成传感器测不出的数据 — AnneliesGamble · 2026-09-22
- 通宵训练类 JEV 模型,120 道难题仅得 24% 分 — BLUECOW009 · 2026-09-22
- 心理学新论文:用社会身份理论解释 AI 时代的错误信念 — steverathje2 · 2026-09-22
- 从业者讨论百万规模 RL 训练:标准 GRPO 为何不用 critic 模型 — stochasticchasm · 2026-09-22