ADANA 论文:momentum cooldown 规则令 token 倍数相对 AdamW 近乎翻倍
_katieeverett · x · 2026-09-10
线程第三问:能否在训练末期缩短 ADANA 的记忆窗口来提升效果?作者提出按 LR 衰减时间尺度缩短窗口的 momentum cooldown 规则,在最高过训练量下使 ADANA 相对 AdamW 的 token 倍数近乎翻倍。
所属事件:ADANA 动量调度优化器在过训练轴上改写 scaling 指数(13 条相关)→
「研究」频道最新
- 研究者用果蝇连接组迭代构造更智能物种的连接组 — airkatakana · 2026-09-11
- CellFluxRL 提出 RL 约束的虚拟细胞建模,投 ECCV 2026 — Prof_Lundberg · 2026-09-11
- PiPNN 近邻搜索算法横扫三会议最佳论文,索引构建提速 78 倍 — khademinori · 2026-09-11
- 《Steerable Visual Representations》登ICML长口头报告 — y_m_asano · 2026-09-11
- OpenCVL 卫星图像配准数据集亮相 ECCV 2026 — ducha_aiki · 2026-09-11
- Diverse VPR 视觉场所识别工作投稿 ECCV 2026 — ducha_aiki · 2026-09-11