注意力是非局部积分、LayerNorm是投影:Transformer的连续化解释

A Mathematical Explanation of Transformers

Xue-Cheng Tai, Hao Liu, Lingfeng Li, Raymond H. Chan

cs.LG, cs.AI, math.NA

2025-10-05

把Transformer encoder写成积分微分方程,再用Lie分裂做时间离散:注意力对应非局部积分,LayerNorm和ReLU对应投影,Nt=6且J=2时精确还原Vaswani 2017的结构。

这篇在解决什么

Transformer 已经是大语言模型的骨架,但各层在数学上对应什么,多数解释停在「注意力加权求和」。已有工作把它看成多粒子常微分方程、高阶样条,或低维流形上的逼近器。这些视角能说明一部分性质,却很难把 self-attention、LayerNorm、前馈层和残差连接一次对齐到同一条连续方程里。

Tai、Liu、Li、Chan 的做法是把整个 encoder 写成一条积分-微分方程,再用算子分裂做时间离散。token 下标和 embedding 维都连续化。注意力变成非局部积分,LayerNorm 变成投影到指定均值和方差的集合,ReLU 变成投影到非负函数。网格化之后,逐步子问题刚好对上 Vaswani 等人 2017 年的模块。

方法

状态是函数 u(x, y, t)。x 是 token 位置,y 是向量分量,t 是沿网络深度的连续时间。

右端拆成三项:

时间上用 Lie 分裂,步长固定为 1。一步里按顺序走:注意力加残差,LayerNorm,J 层线性加 ReLU,把前馈前后做一次平均(对应前馈后的 skip),再一次 LayerNorm。J=2 时,这一步就是一个标准 encoder block。Nt 个时间步就是 Nt 个 block;Nt=6 对上原论文的 6 层 encoder。

空间上把 Ωx、Ωy 均匀网格化,积分变成矩阵乘。单头公式直接变成 Softmax(QK^T/√Ny)V。多头是再给 head 一个连续维 h,离散成 Nh 个头再求和。ViT 在两端加可学习的 patch embedding 和分类头。图像视频把 Q、K、V 的一般积分换成卷积核,就接到 CvT 那一类卷积 Transformer。

训练被写成最优控制:核函数、偏置、σ1 和 σ2 都是控制变量,最小化终端状态和标签之间的损失。

结果

这是一篇纯结构对应的论文,没有下游准确率表。能核对的是离散之后和已有架构逐项重合:

连续对象离散后对应
一步 Lie 分裂一个 encoder block
Nt=6Vaswani 2017 的 6 层 encoder
J=2标准两层前馈网络
对 S1 的投影LayerNorm
对非负集合的投影ReLU
对 head 维积分再离散多头注意力
卷积核替换一般积分一类 CvT

作者强调和粒子系统解释不同。前人把 token 当相互作用粒子,讨论聚类和渐近;这里把整层运算写成同一条积分微分方程的三个算子。CNN 和 UNet 在他们此前工作里也用连续化加分裂,这条线是把 Transformer 接进同一套语言。

为什么重要

对做架构的人,暗示很具体:换分裂格式、换时间离散、换积分核,原则上能导出新网络,而且能借用偏微分方程的稳定性和守恒分析。残差平均那一步被标成数值松弛,和 Runge-Kutta 里为了保范数而做的 relaxation 是同一类手法。

目前还停在「能还原已有结构」。没有新模型,没有新训练算法,也没有证明这条方程适定。对训练工程的直接收益接近零。价值在理论侧:想改 attention 或 Norm 时,至少知道自己在动方程的哪一项。

局限与存疑

作者列了几条未做完的事:前馈层只覆盖 ReLU;只解释 encoder block,不管 decoder 的因果掩码和交叉注意力;位置编码没有写进连续方程;底层积分微分方程的适定性和正则性也还没证。

另外几处读下来站不稳。步长固定为 1,时间步和层数被绑死,「用数值分析指导超参」目前没有例子。前馈的 skip 用前后平均,和常见的 u+FFN(u) 差一个缩放,作者靠把权重写成 (I+W) 来吸收,这是事后对齐,不是从方程推出来的必然。没有实验说明换 Strang 分裂或别的积分核能训出更好的网。Geshkovski 等人的粒子系统理论已经在讨论聚类,这篇几乎不碰动力学行为。

术语

原文与代码

社区讨论

相关论文

全部论文解读