「反 grokking」现象:训练过久反而令泛化能力崩塌

CatAstro_Piyush · x · 2026-09-26

研究者发现并命名了 "anti-grokking" 现象:模型在经历 grokking(训练精度饱和后测试精度突然跃升、实现泛化)之后,如果继续训练,测试精度可能突然崩塌回随机水平,而训练精度仍保持完美。

要点:

这一发现对理解泛化动态与训练停止时机有实际意义。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →