机制可解释性研究:双重下降是记忆与泛化的相变
gordic_aleksa · x · 2026-09-15
Aleksa Gordić 挖出 Anthropic 机制可解释性博客中一个较冷门的发现:双重下降(double descent)可被理解为模型从「记忆单个样本」到「学习可复用结构」的相变。
- 小数据量下,模型把数据点本身当作「特征」,在隐藏空间中为每个样本分配独立方向(附图最下一行的红色多面体;蓝色为权重特征),即逐点记忆。
- 随着数据量增长,模型从数据点特征过渡到跨样本复用的泛化特征——最下一行的记忆结构被摧毁,模型相当于主动「撤销」了此前的记忆。
- 两种策略之间的混乱过渡期造成测试损失出现双重下降的凸起。
泛化似乎在每个底层特征以不同组合出现多次后才会产生(最简单实验中约每特征出现 10 次);重复的数据点会与可复用特征争夺模型容量。
「模型」频道最新
- Atria Dawn Preview 发布:基于 744B MoE 底座,多项 agent 基准领先 — alexcovo_eth · 2026-09-16
- 爆料称 SSI 因行业暂停共识搁置新模型,Ilya 不愿加剧竞赛 — iruletheworldmo · 2026-09-16
- OpenAI 语音服务降价 60%,并推出 ChatGPT 礼品卡 — borowcy · 2026-09-16
- 长文详解:为什么本地跑推理模型是刚需,你需要无审查模型 — HankYeomans · 2026-09-15
- KoboldCpp 发布 v1.121 版本 — Fcking_Chuck · 2026-09-15
- CritPt 基准纠错后 GPT-5.6 pass@4 冲至 94.4% — bookwormengr · 2026-09-15