Neural Operator: Learning Maps Between Function Spaces
Nikola Kovachki, Zongyi Li, Burigede Liu, Kamyar Azizzadenesheli, Kaushik Bhattacharya, Andrew Stuart, Anima Anandkumar
cs.LG, math.NA
2021-08-19
JMLR长文把神经算子做成可证明框架:同时给出网格不变和万能逼近,并对照GNO、LNO、MGNO、FNO四种核,FNO在Darcy上相对误差0.0108,DeepONet约0.048。
ICLR的FNO论文已经把傅里叶核打出来了。这篇JMLR要回答的是更上游的问题:什么样的网络才有资格叫「函数空间上的模型」。普通CNN、GNN、Transformer可以吃任意分辨率输入,但参数或误差在网格加密时不必收敛到一个连续算子。DeepONet能输出函数、有万能逼近,却不能在任意输入点集上直接吃数据。缺一个同时满足三件事的对象:任意输入离散、任意输出查询点、加密后收敛,而且参数量固定。
PDE代理是直接应用,但定义本身针对的是Banach空间之间的连续算子,不绑定某张方程。
神经算子被写成点wise提升、若干层「线性算子 + 逐点激活」、点wise投影。线性层必须是函数空间上的算子,这样端到端才是算子,网格不变才站得住。文中把离散不变说成三条:任意输入点集、任意输出查询、加密收敛到连续极限,参数个数不随网格涨。
线性层给了四种可算的参数化:
理论部分证明:这类模型在紧集上一致逼近连续算子,也在Bochner范数下逼近。输入输出空间覆盖Lebesgue、Sobolev、连续和C^k,比只在Hilbert或C^0上说话的结果更宽。Transformer被放进同一图景:注意力是一种特殊的积分核。相对L2训练比MSE大约能把测试误差砍半,归一化本身在起正则作用。
Darcy,分辨率85到421:
| 方法 | 相对误差 |
| DeepONet | 0.046–0.049 |
| PCANN | 0.030 |
| RBM | 0.024–0.026 |
| GNO | 0.033–0.037 |
| FNO | 0.0108–0.0098 |
Burgers上FNO约0.0018(换GeLU可到0.0007),DeepONet 0.057–0.086,随分辨率变差。一维Poisson用零隐层核网络学Green函数,N=1000时相对误差10^−7,学到的核和解析Green函数对齐,说明训练范数更弱时仍能在更强拓扑里泛化。
NS数字与FNO会议版一致:ν=10^−3、N=1000时FNO-3D误差0.0086;ν=10^−4要N=10000才到0.082。分辨率扫描里FNO几乎不涨,U-Net会涨。GNO可从16×16训完评到241×241。复杂度(V100上每epoch):GNO约4秒、FNO约4秒、MGNO约8秒、LNO约20秒。参数很少时GNO/MGNO更稳;FNO在10^3参数时Darcy误差约0.20,要到10^5–10^6才进入0.02–0.015。噪声鲁棒:干净训练后Burgers带10%噪声测试误差0.018,平流方程0.094,Darcy几乎不变(0.011→0.012)。
这篇是算子学习的「定义+定理+四种实现」手册,不是又一篇把FNO再跑一遍的实验报告。Table 1把话说死:当时只有神经算子同时占据网格不变和万能逼近。后面做PDE代理、天气模型、科学ML backbone的人,多半是在这四种核里挑,或在积分算子骨架上换基底。
FNO仍是光滑均匀网格上的默认选项;不规则网格、少参数场景,GNO/MGNO没有过时。DeepONet在这篇的公平宽度设置下落后一截,但换CNN branch加PCA trunk可以补回来,架构细节会改结论。
完整O(J^2)积分仍比FNO大约好40%,FNO的速度来自把核限制成卷积,不是积分算子的上界。平流等非光滑问题FNO会脆,作者也指向后来用UNet分支补间断的工作,代价是走出严格的网格不变。万能逼近是存在性结果,没有给出达到给定误差的计算复杂度。经验风险最小化是否走到全局最优,文中明确没分析。NS实验网格仍是周期环面,工程几何要另说。