缩放律做到4M参数仍有良好拟合,但选点方法存疑
giffmana · x · 2026-09-22
该论文成功训练了低至 4M 参数的模型并得到看起来合理的缩放律拟合。不过作者指出一个疑点:论文没有说明拟合时如何选择数据点。这点很重要——从图上看 4M 模型的最后一个点明显偏离拟合线,说明选点方式可能影响结论。
所属事件:FAIR与NYU论文将缩放律推至4M参数,超参调优成小模型实验关键(7 条相关)→
「研究」频道最新
- RL 训练大量算力花在 grader 上,跑 30 步值得重新 prefill 吗 — stochasticchasm · 2026-09-22
- Diag2Diag:AI 反哺硬件,生成传感器测不出的数据 — AnneliesGamble · 2026-09-22
- 通宵训练类 JEV 模型,120 道难题仅得 24% 分 — BLUECOW009 · 2026-09-22
- 技术评论:某 RL 训练弃用 PipelineRL 保留 KV cache,改用重新 prefill — stochasticchasm · 2026-09-22
- 心理学新论文:用社会身份理论解释 AI 时代的错误信念 — steverathje2 · 2026-09-22
- 从 Adam 转向 Muon 中期训练?业界热议预训练优化器切换与 mxfp4 QAT — stochasticchasm · 2026-09-22