模型足够小,每尺度256次随机搜索其实很便宜

giffmana · x · 2026-09-22

由于模型极小,论文中每尺度 256 次随机搜索的成本其实不高。但作者提醒:随机搜索的次数只有在说明采样域时才有意义,并给出了论文采样的超参分布——lr 范围偏宽,其余(AdamW、WSD 调度)看起来合理。

所属事件:FAIR与NYU论文将缩放律推至4M参数,超参调优成小模型实验关键(7 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →