Hopfield容量0.138是零温检索旋节线,换规则数字就变

Memory as an Energy Landscape---Hopfield

Nima Dehghani

cs.NE, cond-mat.dis-nn, nlin.AO, physics.bio-ph, q-bio.NC

2026-09-02

这章把Hopfield网络重写成物理理论:对称耦合加异步更新保证能量下降,0.138专指无偏随机Hebbian模式的零温检索旋节。

这篇在解决什么

Hopfield 1982 年那篇 PNAS 经常被缩成一句「联想记忆」或一个数字 0.14N。更早的 McCulloch–Pitts、Hebb、Amari、Anderson、Kohonen、Little 已经有阈值元件、相关记忆和循环二值网络。缺的是一次物理合成:内容寻址变成相空间里的下降,部分线索是初值,回忆是轨迹,纠错是盆地,容量是景观随载荷重组。

这是 MIT 的 Dehghani 为 NeuroAI 教材写的第五章。目标不是再讲一遍算法史。它把二元和连续 Lyapunov 函数推到底,把 0.138 绑回 Amit–Gutfreund–Sompolinsky 的无序系综和成功判据,再沿着能量纲领走到多项式稠密联想记忆、指数相互作用,以及和 scaled dot-product attention 精确重合的那一次更新。

方法

二值自旋 si ∈ {−1,+1},对称耦合且对角为零。局部场 hi,零温异步更新 si ← sgn hi。能量 E = −1/2 ∑ Jij si sj。只翻一个自旋时 ΔE = −(s′−s)hi,与场不一致的翻转严格降能。有限状态加上能量不增,异步确定性动力学有限步到达不动点。证明用到三件事:对称、异步、到达的是局部极小而不是指定记忆。全同步更新即使 J 对称也可以做出二循环。

记忆写入用 Hebb 外积 Jij = (1/N) ∑μ ξi^μ ξj^μ。能量改写成重叠的平方和,设计意图立刻可读:降能奖励跟某一存储模式对齐。在存储模式附近,局部场拆成检索信号加串扰。朴素高斯估计给出误翻转概率 Φ(−1/√α),但检索过程里状态和无序相关,完整平均场把噪声方差改成 αr,r 由磁化率反馈重整。

副本对称方程在 T→0 时收成误差函数闭合。沿 α 延拓,非零检索支在 αc ≃ 0.138 处终止。这是稠密、对称、Hebbian、无偏随机模式、热力学极限下的零温动力学检索旋节线。1984 年的连续模型把二元翻转换成单调响应 Vi=gi(ui) 和电路方程,能量里多一项逆响应积分,dE/dt = −∑ Ci g′(ui)(u̇i)^2 ≤ 0。对称加单调就够,不需要二值。

后续把能量从二次重叠改成更尖的 F。多项式 F(x)=x^n 给出稠密联想记忆,固定比特误差容量按 N^{n−1} 走,整模式零误差再多一个 ln N。指数相互作用在分离条件下给出 K ∼ e^{cN},0<c<ln 2/2。连续现代 Hopfield 用 log-sum-exp 能量,不动点更新 x ← X softmax(β X^T x)。令 V=K=X^T 且 β=1/√dk,这一式与 scaled dot-product attention 代数重合。

结果

教材用固定种子 1982 的复制实验把机制摊开,不替代解析结果。N=400、18 个随机模式、翻转 28% 的线索从重叠 0.44 收敛到 1,能量全程下降,这只证明存在盆地。零温平均场延拓在作图分辨率下终止于 α≈0.1376;有限 N 同步仿真的过渡被抹圆,平均重叠和 m>0.9 两条判据并不重合。连续模型 N=120、4 个模式、g=tanh(2.2u),能量降到数值精度,目标重叠约 0.966,单元仍连续。

副本对称给出 αc≃0.137905,一步 RSB 修到 0.138186,两步 0.138187,有限尺寸模拟常被说成接近 0.14。三模式多数投票混合物在大 N 极限重叠各为 1/2,领先能量约 −3N/8,纯记忆是 −N/2,混合物仍可局部稳定。能量极小不等于设计记忆。

说法精确口径
容量是 0.14N0.138 是该系综的 T=0 检索旋节
能量下降能做优化只保证到驻点,不保证全局最优
注意力就是 Hopfield仅当键值等于存储模式时,一次更新重合

为什么重要

对做 Transformer 和联想记忆的人,这篇把口号拆回假设。0.138 不能当通用容量;换学习规则、稀疏编码、成功判据,数字就换。attention 可以精确等于一次现代 Hopfield 更新,多层、多头、残差、因果掩码和 Q/K/V 分家之后,Transformer 并不是在求一个对称能量的平衡。对神经科学,有效理论的问题变成:多少不对称、延迟、适应和持续输入可以被积掉,才必须换非平衡描述。

局限与存疑

作者自己划的边界清楚。能量下降既不保证落到想要的记忆,也不解决 NP-hard 优化。真实化学突触有方向,一般循环网络不必有能量;延迟、适应、脉冲时序和驱动可以产生环、序列、亚稳或混沌,这些不在证明的假设里。Hebb 外积是嵌入处方,不是完整的生物学习理论。点神经元假设在树突非线性或调质改变回忆时标时会不够。指数容量需要范数和分离条件,相关模式会合并。复制脚本展示机制,图 2 不测容量,图 6 不证明指数容量。

术语

原文与代码

社区讨论

相关论文

全部论文解读