模型足够小,每尺度256次随机搜索其实很便宜
giffmana · x · 2026-09-22
由于模型极小,论文中每尺度 256 次随机搜索的成本其实不高。但作者提醒:随机搜索的次数只有在说明采样域时才有意义,并给出了论文采样的超参分布——lr 范围偏宽,其余(AdamW、WSD 调度)看起来合理。
所属事件:FAIR与NYU论文将缩放律推至4M参数,超参调优成小模型实验关键(7 条相关)→
「研究」频道最新
- Frontier Data Summit 2026 议程曝光:十余个新 benchmark 集中亮相 — dlwh · 2026-09-22
- RL 训练大量算力花在 grader 上,跑 30 步值得重新 prefill 吗 — stochasticchasm · 2026-09-22
- Diag2Diag:AI 反哺硬件,生成传感器测不出的数据 — AnneliesGamble · 2026-09-22
- 通宵训练类 JEV 模型,120 道难题仅得 24% 分 — BLUECOW009 · 2026-09-22
- 心理学新论文:用社会身份理论解释 AI 时代的错误信念 — steverathje2 · 2026-09-22
- 从业者讨论百万规模 RL 训练:标准 GRPO 为何不用 critic 模型 — stochasticchasm · 2026-09-22