模加法 Transformer 训练可视化:2 千步到 2 万步学到环状结构

Sauers_ · x · 2026-09-24

作者 @Sauers 展示了模加法(modular addition)Transformer 在 2k 与 20k 训练步后的可视化对比:按顺时针方向排列 113 个可能的输出 token,每个环代表一次加法的两个输入数,颜色表示 token 的 logprob。训练到 2 万步后,模型内部形成了清晰的环状结构,直观呈现了模型如何逐步「学会」模加法(即知名的 Grokking 现象的可视化)。作者还 lamented 图里有笔误改不了。

所属事件:模加法 Transformer 训练过程可视化走红(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →