GPT-6 独立推导 100 分钟,随机神经网络 38 年混沌谱难题告破

Lyapunov spectrum of random neural networks

David G. Clark

cond-mat.dis-nn, q-bio.NC

2026-10-09

解析导出随机循环神经网络在 N→∞ 的完整 Lyapunov 谱,理论与 N=4096 模拟吻合,证明混沌是广延的;初始推导由 GPT-6 独立工作 100 分钟完成。

这篇在解决什么

1988 年,Sompolinsky、Crisanti 和 Sompolinsky 提出了随机循环神经网络:N 个神经元,耦合矩阵的每个元素独立抽取自高斯分布,不对称、无结构。耦合强度 g 超过 1 时网络进入混沌相,这个模型长期被当作皮层自发活动的标准理论模型,也是训练 RNN 执行任务的常用底座。奠基论文留了一个开放问题:算出整个 Lyapunov 指数(Lyapunov exponents,相邻轨迹沿各方向指数分离或收缩的速率)的分布。此后 38 年,最大指数有了解析式,连续时间下化成一个薛定谔型方程的基态能量;全谱只有数值结果,靠 QR 方法模拟大网络。这篇在 N→∞ 极限下把全谱解析地算了出来。

为什么在乎全谱:最大指数只回答混沌不混沌,全谱给出吸引子维度(Kaplan–Yorke 公式)和熵率(正指数之和),这两个量在坐标变换下不变,是动力学本身的属性。

方法

推导分三步。

第一步是有限 N 的精确恒等式,也是全篇最漂亮的一步。数低于阈值 s 的指数个数,等价于把所有指数整体下移 s 之后数衰减方向的个数。传统做法沿轨迹演化切向量、设初始条件;这里换了个问法:在双向无穷的时间窗口上,不给初始条件,给一个源,取最小范数解。可以证明这个解在源之前沿不稳定子空间反向生长、在源之后沿稳定子空间正向衰减,是唯一有界的解,而它的一步响应矩阵恰好是稳定子空间上的投影矩阵。投影矩阵的迹等于稳定方向的个数,除以 N 就是指数的累积分布 F(s)。恒等式对任意有限 N 精确成立。

第二步把最小范数解改写成平均场方法能处理的形式:它是一个正则化最小二乘问题在正则化参数 η→0 时的极限,而这个问题的最优性条件构成前后向动力系统,一个 N 维场沿时间正向演化,另一个反向,η>0 把两者耦合起来并保证解唯一。这个构造与非厄米随机矩阵谱理论里的 Hermitization 技巧同源。

第三步用 cavity 方法(往大网络里临时加一个神经元,自洽求解其余网络对它的有效作用)联合处理网络动力学和前后向系统。大 N 下,新神经元感受到一个高斯腔场加两个自洽核,腔场统计由标准的动力学平均场理论(DMFT,把大网络化成单个神经元被自洽高斯过程驱动)给定,神经元的增益轨迹(非线性函数沿活动的斜度)驱动两个场。最后数值迭代这个单点问题,把 η 降到零,读出 F(s)。

推导只有一个承重假设:N→∞ 与 η→0 两个极限可以交换次序。论文坦承这一点没有数学证明,支撑它的是与模拟的吻合,以及随机矩阵理论里同类交换的惯例。

结果

理论先过了两道已知答案的测试,并把它们从 δ→0 和 δ=1 两个端点推广到任意时间步 δ,随后与模拟对照:N=4096 的网络,QR 方法算谱,单点理论在 g=3、g=5、δ 从 0.05 到 0.5 的范围内与模拟点密合(Fig. 1)。

对照已有结果这篇给出的
不动点处的谱圆律,仅 δ→0 与 δ=1推广到任意 δ
最大指数 λ1两个端点各一个公式统一为有限 δ 的非线性本征值问题
完整谱仅数值(QR 模拟)大 N 解析理论,与 N=4096 模拟吻合

两个直接推论。混沌是广延的(extensive,指吸引子维度和熵率都随 N 线性增长,归一化后趋于确定值),正指数个数与 N 成比例;这一点 Sompolinsky 当年只给了平均场论证,Engelken 等人给了数值证据,现在是推导的副产品。吸引子维度随 g 先增后饱和,在 δ=0.5 时约 g=10 处达峰后回落;熵率在计算范围内单调增。

为什么重要

对神经科学理论圈,这关掉了一个挂了近四十年的招牌问题。加上此前的参与比维度计算,Fig. 2 里的所有量现在都能从理论算出,此前拿这些量只能跑大模拟。

对机器学习,这条线比看上去近。深度网络初始化时的有序-混沌转变、训练 RNN 时把 Lyapunov 指数压向零以学长程依赖、looped transformer 的推理动力学在难题上疑似瞬态混沌,论文在 related work 里逐个点名:这些分析目前用的都是单个指数或数值谱,解析谱是更锋利的工具。

对怎么做研究,这篇是个少见的透明样本。作者原本认为该问题解析不可解,题目由同行 Litwin-Kumar 建议作为 AI 辅助攻坚的目标;GPT-6 Astra 在一个已有前期工作的会话里收到一段指令后独立工作 100 分钟,产出与模拟吻合的初始推导;作者随后与 GPT-6 和 Claude Opus 5.5 一起,把原推导里 Deninger 定理、Fuglede–Kadison 对数行列式这些厚重工具全部拆掉,换成物理图像更透明的最小范数推导;Claude Opus 5.5 写了全部代码、生成全部图并做数值验证。论文附了完整的 AI methodology 一节,给 GPT-6 的 prompt 原文都贴了出来。

局限与存疑

作者自己承认的:核心的极限交换没有数学证明,更严格的处理按作者原话「beyond the expertise of the author」,论文建议将来在证明助手里形式化。

模型范围窄:只覆盖 i.i.d. 高斯耦合、tanh 非线性的 rate 网络。多群体(兴奋/抑制分离)、低秩耦合、脉冲网络都列为未来工作。理论最后一步仍是数值迭代,严格说是解析归约加数值求解,不是闭式解。验证只展示 g=3、g=5、δ 在 0.05 到 0.5 之间,强耦合和更小时间步的极端区间没给。AI 产出的推导,验证手段是已知极限恢复加模拟吻合,没有独立第三方复核,不过这也正是这个领域的常规标准。

术语

原文与代码

社区讨论

相关论文

全部论文解读