Grokking 不是魔法:权重衰减压缩空间振荡才是泛化关键

burny_tech · x · 2026-10-01

一篇技术长线程指出,Grokking(先记住训练集、很久后才泛化)并非「平坦极小值」所能解释。作者提出:网络在快时间尺度上拟合训练点,而样本外泛化是另一个更慢的物理过程——权重衰减逐渐收缩网络在输入域上的空间振荡,从而完成泛化。线程以数学推导展开论证。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →