新论文发现 grokking 第三阶段:训练后期泛化会崩溃回随机水平
sytelus · x · 2026-09-20
Prakash 与 Charles Martin 的 arXiv 论文在两个经典 grokking 实验(MNIST 子集上的 3 层 MLP、模加法 transformer)中把训练时间大幅延长,发现一个此前未报告的第三阶段:anti-grokking——模型先完成记忆到泛化的跃迁,之后测试准确率崩回随机水平,而训练准确率仍保持完美。
- 诊断工具:开源 WeightWatcher(基于 HTSR/SETOL 理论),核心信号是打乱权重矩阵谱密度中出现超出 Marchenko–Pastur 主体的大特征值,即 Correlation Traps;辅助信号是 HTSR 层质量指标 α 偏离 2.0。
- 关键卖点:两种信号都不需要访问任何训练或测试数据,直接从权重矩阵即可检测过拟合/反泛化特征。
- 作者指出这种晚期过拟合与以往观察到的形态不同,对极长训练、蒸馏等场景有诊断价值。
所属事件:新论文发现 grokking 第三阶段:训练后期泛化崩溃(2 条相关)→
「研究」频道最新
- 曝 OpenAI 接近解决千禧年大奖难题之一霍奇猜想 — burny_tech · 2026-09-20
- 新论文:GPU 拥塞会逆转 SFT 与 ICL 个性化收益排序 — zainhas · 2026-09-20
- 离体人脑组织连接机械手,凭听觉自学弹钢琴 — mjdramstead · 2026-09-20
- 涌现能力怎么定义?Wei et al 2022 阈值说 vs 泛化说之争 — gabriberton · 2026-09-20
- 新基准 JevBench:综合智能、校准、速度与成本评模型 — rohanpaul_ai · 2026-09-20
- ICLR 投稿破5万还剩一周,同行评审体系恐难以为继 — burny_tech · 2026-09-20