谱神经元读对称矩阵特征值,HIGGS上log loss从线性0.64降到0.52

The Spectral Neuron

Alex Shtoff

stat.ML, cs.LG

2026-08-08

谱神经元把特征写进对称矩阵并读第k个特征值。维数可扩,凸性与单调可构造保证。HIGGS上d=11的log loss约0.52,线性模型停在0.64。

这篇在解决什么

表格场景经常要同时做两件事:预测够准,系数还能讲给人听。保险定价要向客户解释风险从哪来,广告竞价要保证赢标概率随出价上升,监管要看清哪个特征把分数拉高。线性模型把故事写在系数上,表达力很快到顶。树模型和神经网络能拟合更复杂的关系,换来的是不连续的跳跃,以及参数不再直接可读。

形状约束网络和 lattice 能强制单调或凸,但架构要专门改。GAM 和 NAM 可读,交互被限制在低维。缺一块能随规模变强、形状可构造保证、特征影响又能从参数直接读出来的原语。

方法

谱神经元(spectral neuron)把经典神经元里的标量权重换成对称矩阵,把逐点非线性换成特征值。对输入 \(x \in \mathbb{R}^n\),学一组 \(d \times d\) 实对称矩阵 \(A0,\ldots,An\),预测

\[fk(x)=\lambdak\bigl(A0+\sumi xi Ai\bigr)\]

\(\lambdak\) 是第 \(k\) 小的特征值。矩阵维数 \(d\) 是扩容旋钮,指标 \(k\) 是形状旋钮。阿布扎比 Technology Innovation Institute 的 Alex Shtoff 把这个对象当成可训练的机器学习原语来写,而不是再发明一套优化器。

非线性的来源是显式的,所以一批经典谱结果可以直接翻译成模型性质:

训练走现成自动微分。PyTorch 的 torch.linalg.eigh 已经按 Clarke 次微分给反向。初始化必须躲开两个坑。若所有矩阵可同时对角化,模型塌成仿射函数的次序统计量(最大特征值对应 maxout),而「过去梯度的线性组合」这类更新会把参数锁在这块。若被选特征值与邻居离得太近,Davis-Kahan 说特征向量对扰动极度敏感,梯度跟着抖。做法是把 \(A0\) 旋到 \(\mathrm{diag}(-1,\ldots,0,\ldots,1)\),零落在第 \(k\) 位,其余 \(Ai\) 取 \(\alphai I\) 加小对角抖动,在特征大致标准化时把初始化处的 eigengap 保在 \(1/2\) 以上。

代价是实在的。线性模型大约 \(2n\) FLOPS;这里训练大约 \(n d^2+(14/3)d^3\),推理大约 \(n d^2+(4/3)d^3\)。换来的是表达力、形状约束和系数可读,捆在同一组矩阵上。

结果

论文明确不报 SOTA。实验是缩放曲线:优化器一律 Adam,取中间特征值,\(d\) 取奇数以免两个中位并列。数字从图中读出,原文没有另列表格。

一元合成函数上,复杂度升高必须加维。无噪声、复杂度 10 时,\(d=5\) 的 RMSE 在约 0.2 处走平,\(d=15\) 还能降到约 0.015。复杂度 20 时同样:\(d=5\) 停在约 0.55,\(d=15\) 到约 0.09。目标本身单调时,半正定约束在小样本更帮得上忙。二元函数复杂度 13,\(d=15\) 仍能继续降,低维曲线加数据也走平。

真实数据两套,交叉熵,batch 4096。

设置数据对照谱神经元
HIGGS,\(d=3\)(174 参数)1100 万行,28 个数值列,最多 \(2^{26}\) 样本线性约 0.64log loss 约 0.57
HIGGS,\(d=11\)(1914 参数)同上线性仍约 0.64;2/3 层 MLP 约 0.505约 0.52
Criteo,\(d=3/7/11\)4584 万行,26 类别 + 13 数值,最多 \(2^{28}\)线性与因子分解机都落在约 0.45–0.46数值当连续值时略低,约 0.45

Criteo 上把数值当数值(\(\ln^2(1+x)\) 后标准化)优于分箱。参数量对齐的因子分解机把 embedding 从 5 加到 65,后期几乎不降,最大档在 \(2^{28}\) 处回升到约 0.475。谱神经元随 \(d\) 有小幅改善。

HIGGS 上把单特征扰动写成 \(\delta=\varepsilon\sigmai\),\(\varepsilon\in[-0.5,0.5]\),实测 \(|\Delta f|/(|\delta|\|Ai\|2)\) 大多远小于 1,上界不是空话。矩阵越大,这个比值越往 0 挤,上界变松。论文自己提示,后面可能需要谱范数正则,在精度和影响上界的松紧之间做权衡。

为什么重要

这是建模原语,不是刷榜架构。适合已经知道某些坐标必须单调或凸、同时又想把特征影响写成「和线性系数同类的东西」的表格任务:保险风险、竞价 CDF、监管解释。超网络设定里,神经网络只负责从无约束的上下文吐出 \(\{Ai\}\),谱神经元负责保证对出价单调。这比在深层网络上补约束干净。

HIGGS 上深度 \(\ge 2\) 的 MLP 仍略强。若唯一目标是 log loss,没有理由换。换的理由是同一组参数同时给出形状保证和影响上界,而且放大 \(d\) 不会把解释通道弄丢。

局限与存疑

对称特征值是 \(O(d^3)\),没有只求单个特征对的自定义核,特征一多这就是硬成本。实验只测了中间特征值,凸/凹两个端点的可学习性没有同等规模验证。多个半定矩阵的参数化几乎没摸,单调实验基本是「最后一个特征、对角且非负」。

真实数据只有 Criteo 和 HIGGS。特征影响上界随 \(d\) 变松,大矩阵上系数可读性会稀释。构造本身已在 PMM 框架里,这篇的贡献是当成可训练原语,配上初始化、形状控制和缩放实验。初始化启发式假设特征大致标准化、幅度很少超过 5,分布一偏就可能踩到小 gap。

术语

原文与代码

社区讨论

相关论文

全部论文解读