可视化 modular addition transformer:2k 步与 20k 步训练差异一目了然

Sauers_ · x · 2026-09-24

作者展示了一个做模加法(modular addition)的 transformer 在不同训练阶段的行为可视化:把 113 个可能输出 token 按大小顺时针排成一个圆环,每圈代表一个被加的数,颜色表示对应 token 的 logprob。对比显示,训练 20k 步(左)后模型输出分布明显形成有序结构,而 2k 步(右)时分布仍然杂乱,直观呈现了模型从混沌到学会模加法结构的过程。

所属事件:模加法 Transformer 训练过程可视化走红(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →