「反 grokking」现象:训练过久反而令泛化能力崩塌
CatAstro_Piyush · x · 2026-09-26
研究者发现并命名了 "anti-grokking" 现象:模型在经历 grokking(训练精度饱和后测试精度突然跃升、实现泛化)之后,如果继续训练,测试精度可能突然崩塌回随机水平,而训练精度仍保持完美。
要点:
- 常规 grokking 进度指标(L2 权重范数、激活稀疏度、权重熵)能追踪初始 grokking 阶段,但在 anti-grokking 阶段完全持平,无法预警崩塌。
- 作者使用 WeightWatcher 诊断工具分析层权重矩阵的经验谱密度(empirical spectral density)来检测该现象。
- 机制上,anti-grokking 由 "Correlation Traps" 驱动:训练后期出现的异常大特征值,严重阻碍泛化。
这一发现对理解泛化动态与训练停止时机有实际意义。
「研究」频道最新
- 研究显示知识蒸馏常难复现教师模型,学生还会放大其过度自信 — deliprao · 2026-09-26
- ResolVI 用误差建模修正单细胞数据,假信号从 14.8% 降至 0.01% — bravo_abad · 2026-09-26
- 先定维度再生成:Hamel 讲 evals 合成数据的正确姿势 — HamelHusain · 2026-09-26
- LeCun 团队借鉴人脑视觉机制,目标导航成功率翻倍至 94% — alex_verem · 2026-09-26
- JHU 团队 AgentOdyssey 获 NeurIPS 接收,专测智能体测试时持续学习 — DanielKhashabi · 2026-09-26
- TLA+ 因 Claude 团队一条推爆红:形式化验证遇上 Agent 编码 — fhuszar · 2026-09-26