Grokking 不是魔法:权重衰减压缩空间振荡才是泛化关键
burny_tech · x · 2026-10-01
一篇技术长线程指出,Grokking(先记住训练集、很久后才泛化)并非「平坦极小值」所能解释。作者提出:网络在快时间尺度上拟合训练点,而样本外泛化是另一个更慢的物理过程——权重衰减逐渐收缩网络在输入域上的空间振荡,从而完成泛化。线程以数学推导展开论证。
「研究」频道最新
- 北大清华阿里开源 SparkDiffusion,AI 视频生成提速 265 倍 — lmoroney · 2026-10-01
- AgentTell 基准:浏览器 Agent 61% 场景下行为泄密 — kagnlp · 2026-10-01
- Qwen3.8-Flash-Next 砍掉 44% 专家,Terminal-Bench 达 70% — rmonsurate · 2026-10-01
- NVIDIA 发布 LongLive-Plug:一次蒸馏 LoRA 即插即用于 54 个视频模型 — _akhaliq · 2026-10-01
- Omni-IO Skills 开源框架让通用 Agent 掌握 27 项多模态技能 — _akhaliq · 2026-10-01
- LEGO-Anything:用编码智能体把单张图重建为可编辑 3D 场景 — _akhaliq · 2026-10-01