ADANA 论文线程续篇:优化器指数级优势的补充实验与局限说明

_katieeverett · x · 2026-09-10

Katie Everett 对其 ADANA 优化器论文线程做 Part 2 总结,并附三点注意事项:模型较小(51M–253M)、固定 batch(256×2048),batch 增大时 ADANA 可能更早失去效率优势;部分点需外推基线拟合;更多实验即将推出。同帖强调这是首次被说服优化器能在 Transformers 中真正改变 scaling 指数。

所属事件:ADANA 动量调度优化器在过训练轴上改写 scaling 指数(13 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →