十四位理论学者主张:深度学习正在长出一门「学习力学」

There Will Be a Scientific Theory of Deep Learning

Jamie Simon, Daniel Kunin, Alexander Atanasov, Enric Boix-Adserà, Blake Bordelon, Jeremy Cohen, Nikhil Ghosh, Florentin Guth, Arthur Jacot, Mason Kamb, Dhruva Karkada, Eric J. Michaud, Berkan Ottlik, Joseph Turnbull

stat.ML, cs.LG

2026-04-23

伯克利与Flatiron等十四人把可解模型、无穷宽极限、缩放律和μP收成「学习力学」,主张它做深度学习的物理学,机制可解释做生物学。

这篇在解决什么

深度学习用得越来越大,理论却长期停在「能表达、能泛化、能优化」的古典问题上。多层、非凸、过参数化的网络,训练和泛化都好过古典界能保证的范围,还学出有结构的内部表示。十四位作者来自伯克利、哈佛、Flatiron、纽约大学、斯坦福和宾大,通讯作者 Jamie Simon。他们的判断是:已经有一门科学理论在成形,能刻画训练过程、隐藏表示、最终权重和性能的粗粒统计,并给出可证伪的定量预言。

他们给这门东西起名 learning mechanics,学习力学。类比很硬:机制可解释是深度学习的生物学,学习力学该做它的物理学。

方法

文章是立场综述,没有新定理,也没有新的大规模实验。论证结构是五条正在变厚的证据,再加和其他视角的关系图,以及十个他们认为十年内该被力学回答的方向。

五条证据各自对应物理学里用熟的工具:

力学的标准写得很满:从训练方程的第一性原理出发,必须是数学的、可预测的,覆盖训练与表示与权重,直觉上简单,最终对工程有用,并且老实划出失效边界。

结果

这篇没有基准表。能当结果报的,是一张和物理学对照的地图,外加十个开放方向。

证据深度学习里的例子物理类比
可解设定深度线性网、NTK谐振子、氢原子
无穷极限懒惰/富特征、无限深热力学极限
经验定律缩放律、稳定性边缘开普勒、欧姆
超参理论μP、线性缩放规则雷诺数、无量纲化
普遍行为跨架构表示趋同临界现象

开放方向包括:同时非线性于数据和参数的可解模型、能吃进自然数据结构的理论、是否在隐式最小化某种函数复杂度、特征的形式化定义、有限网是不是无穷极限的离散化、能不能消掉超参、缩放指数的先验预测、曲率与泛化和特征的关系、什么样的优化器算好、不同训练设置学到的表示究竟有多像。配套站点是 learningmechanics.pub。

对怀疑论的回应也写进了正文。理论对象比大模型原始得多:他们承认近期只能先做局部理论,缩放律、μP、NTK 数据归因、有理论动机的优化器已经在大模型栈上好用。有人说该研究的是数据:两条都要。有人说模型会先理解自己:过渡期仍是人带着模型做科学,安全还需要人能读的理论。

为什么重要

从业者已经在用这张地图上的几块:按缩放律买算力,用 μP 把学习率从窄模型搬到宽模型,用稳定性边缘解释学习率不能再加大。这篇的贡献是给这些散件一个共同名字和评价标准,并明确说机制可解释不该单干。力学提供平均行为、相变和超参的方程;可解释提供电路和特征。两边共用「特征到底是什么」这个问题。

它还把理论的成功标准从最坏情况界,扭到可重复的平均预言。对做大模型的人,这意味着一篇理论论文该被问:你预言了哪条曲线,测了没有。

局限与存疑

立场文不是证明。可解模型和无穷极限仍然大量停在玩具或理想化设定,和前线 LLM 之间的跨度,作者自己也写成开放问题。给这门研究起名「力学」,类比有启发,也有过拟合风险:神经网络没有物理学意义上的守恒律,梯度也不是真正的场。「生物学对物理学」这句口号很响,两个社区日常仍常各说各话。缩放指数先验预测、自然数据的充分统计量,正文承认还没有。对初学者的建议是在建社区,不能当成科学结果读。

术语

原文与代码

社区讨论

相关论文

全部论文解读