WeightWatcher 追踪发现:K 矩阵功率谱指数 α 可预测 LLM 记忆化
rickasaurus · x · 2026-09-24
一项初步分析用 WeightWatcher 工具研究 LLM 如何记忆随机输入:当训练数据中部分标签被故意替换为随机标签后,模型最终会记住这些错误标签,干净测试集准确率随之下降。
研究者在整个训练过程中监控权重谱,发现了强的层级特异性信号:
- 最清晰的效果出现在注意力 K 矩阵上
- 随着随机标签记忆化加剧,K 矩阵的功率律指数 α 会先降到、再跌破临界值 α = 2
- 该关系跨多个独立随机种子高度可复现,K α 与记忆化程度的平均秩相关约 ρ ≈ −0.90
- 效果在 WeightWatcher 的 fixfingers 修正后依然存在,排除了少数异常特征值的伪影可能
这意味着 α 指数有望作为训练中记忆化的实时监测信号。
「研究」频道最新
- Lotus 作者谈语义算子:大规模 LLM 数据处理需全栈重新设计 — CShorten30 · 2026-09-24
- Jev 处理 10 万行表格仅花 $2.50、60 秒内完成,作者称被低估 — CShorten30 · 2026-09-24
- CLM-8B 发布:轻量微调即破 DeepSWE 81.6%,推理快 9 倍 — anshulkundaje · 2026-09-24
- 浙大 SpeakerMem-R1:多人对话记忆登顶 EverMemBench 榜单 — zju · 2026-09-24
- CMU 发布 WhatWorkedBench:测 AI 研究智能体的实验理解能力 — CarnegieMellonU · 2026-09-24
- 腾讯发布 RewardVerse:Rubric 引导优化解决视频奖励标量漂移 — tencent · 2026-09-24