新论文发现 grokking 第三阶段:训练后期泛化会崩溃回随机水平

sytelus · x · 2026-09-20

Prakash 与 Charles Martin 的 arXiv 论文在两个经典 grokking 实验(MNIST 子集上的 3 层 MLP、模加法 transformer)中把训练时间大幅延长,发现一个此前未报告的第三阶段:anti-grokking——模型先完成记忆到泛化的跃迁,之后测试准确率崩回随机水平,而训练准确率仍保持完美。

所属事件:新论文发现 grokking 第三阶段:训练后期泛化崩溃(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →