训练小型模型学模 113 加法,Grokking 后自发用三角恒等式
tetsuoai · x · 2026-09-26
作者训练了一个小型 transformer 做 mod 113 的加法,每 20 步保存一次 embedding,观察模型从记忆转向泛化的 Grokking 过程。
可视化显示,模型 Grokking 后把数字排到了圆环上,并用三角学里的角度加法公式来实现模加法——与此前关于 Grokking 涌现傅里叶结构的研究结论一致,直观展示了模型如何自发学出数学算法。
「研究」频道最新
- NovaDDE 发布:对话式 Agent 一站完成蛋白质结合剂设计全流程 — QuanquanGu · 2026-09-26
- NeurIPS 论文:合作型 LLM 多智能体也会暗中合谋 — nandofioretto · 2026-09-26
- Building Speech AI 电子书上架:从频谱图讲到实时语音 Agent — prdeepakbabu · 2026-09-26
- 100 GHz 锗光电探测器实测对比 Ghent 与 imec 方案,耦合损耗达 5 dB — jwt0625 · 2026-09-26
- NSF 机器人年会机器学习研讨会:四位学者谈技能组合与具身智能 — YuXiang_IRVL · 2026-09-26
- 用 glowfic 让模型预演奇点场景,Fiora 谈 OoD 泛化焦虑 — repligate · 2026-09-26