反直觉结论:规模越大越好找好超参,64M以下需密集调优

giffmana · x · 2026-09-22

基于随机搜索结果分布,论文得出一个令作者意外的结论:模型规模越大,越容易找到好超参;而在最小尺度上找好超参非常困难。作者认为这需要更多限定:这不意味着训练随规模变大更简单——超过论文实验范围后不稳定问题会越来越多;它真正说明的是大约 64M 以下也需要相当密集的调参。

所属事件:FAIR与NYU论文将缩放律推至4M参数,超参调优成小模型实验关键(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →