The Spectral Neuron
Alex Shtoff
stat.ML, cs.LG
2026-08-08
谱神经元把特征写进对称矩阵并读第k个特征值。维数可扩,凸性与单调可构造保证。HIGGS上d=11的log loss约0.52,线性模型停在0.64。
表格场景经常要同时做两件事:预测够准,系数还能讲给人听。保险定价要向客户解释风险从哪来,广告竞价要保证赢标概率随出价上升,监管要看清哪个特征把分数拉高。线性模型把故事写在系数上,表达力很快到顶。树模型和神经网络能拟合更复杂的关系,换来的是不连续的跳跃,以及参数不再直接可读。
形状约束网络和 lattice 能强制单调或凸,但架构要专门改。GAM 和 NAM 可读,交互被限制在低维。缺一块能随规模变强、形状可构造保证、特征影响又能从参数直接读出来的原语。
谱神经元(spectral neuron)把经典神经元里的标量权重换成对称矩阵,把逐点非线性换成特征值。对输入 \(x \in \mathbb{R}^n\),学一组 \(d \times d\) 实对称矩阵 \(A0,\ldots,An\),预测
\[fk(x)=\lambdak\bigl(A0+\sumi xi Ai\bigr)\]
\(\lambdak\) 是第 \(k\) 小的特征值。矩阵维数 \(d\) 是扩容旋钮,指标 \(k\) 是形状旋钮。阿布扎比 Technology Innovation Institute 的 Alex Shtoff 把这个对象当成可训练的机器学习原语来写,而不是再发明一套优化器。
非线性的来源是显式的,所以一批经典谱结果可以直接翻译成模型性质:
训练走现成自动微分。PyTorch 的 torch.linalg.eigh 已经按 Clarke 次微分给反向。初始化必须躲开两个坑。若所有矩阵可同时对角化,模型塌成仿射函数的次序统计量(最大特征值对应 maxout),而「过去梯度的线性组合」这类更新会把参数锁在这块。若被选特征值与邻居离得太近,Davis-Kahan 说特征向量对扰动极度敏感,梯度跟着抖。做法是把 \(A0\) 旋到 \(\mathrm{diag}(-1,\ldots,0,\ldots,1)\),零落在第 \(k\) 位,其余 \(Ai\) 取 \(\alphai I\) 加小对角抖动,在特征大致标准化时把初始化处的 eigengap 保在 \(1/2\) 以上。
代价是实在的。线性模型大约 \(2n\) FLOPS;这里训练大约 \(n d^2+(14/3)d^3\),推理大约 \(n d^2+(4/3)d^3\)。换来的是表达力、形状约束和系数可读,捆在同一组矩阵上。
论文明确不报 SOTA。实验是缩放曲线:优化器一律 Adam,取中间特征值,\(d\) 取奇数以免两个中位并列。数字从图中读出,原文没有另列表格。
一元合成函数上,复杂度升高必须加维。无噪声、复杂度 10 时,\(d=5\) 的 RMSE 在约 0.2 处走平,\(d=15\) 还能降到约 0.015。复杂度 20 时同样:\(d=5\) 停在约 0.55,\(d=15\) 到约 0.09。目标本身单调时,半正定约束在小样本更帮得上忙。二元函数复杂度 13,\(d=15\) 仍能继续降,低维曲线加数据也走平。
真实数据两套,交叉熵,batch 4096。
| 设置 | 数据 | 对照 | 谱神经元 |
| HIGGS,\(d=3\)(174 参数) | 1100 万行,28 个数值列,最多 \(2^{26}\) 样本 | 线性约 0.64 | log loss 约 0.57 |
| HIGGS,\(d=11\)(1914 参数) | 同上 | 线性仍约 0.64;2/3 层 MLP 约 0.505 | 约 0.52 |
| Criteo,\(d=3/7/11\) | 4584 万行,26 类别 + 13 数值,最多 \(2^{28}\) | 线性与因子分解机都落在约 0.45–0.46 | 数值当连续值时略低,约 0.45 |
Criteo 上把数值当数值(\(\ln^2(1+x)\) 后标准化)优于分箱。参数量对齐的因子分解机把 embedding 从 5 加到 65,后期几乎不降,最大档在 \(2^{28}\) 处回升到约 0.475。谱神经元随 \(d\) 有小幅改善。
HIGGS 上把单特征扰动写成 \(\delta=\varepsilon\sigmai\),\(\varepsilon\in[-0.5,0.5]\),实测 \(|\Delta f|/(|\delta|\|Ai\|2)\) 大多远小于 1,上界不是空话。矩阵越大,这个比值越往 0 挤,上界变松。论文自己提示,后面可能需要谱范数正则,在精度和影响上界的松紧之间做权衡。
这是建模原语,不是刷榜架构。适合已经知道某些坐标必须单调或凸、同时又想把特征影响写成「和线性系数同类的东西」的表格任务:保险风险、竞价 CDF、监管解释。超网络设定里,神经网络只负责从无约束的上下文吐出 \(\{Ai\}\),谱神经元负责保证对出价单调。这比在深层网络上补约束干净。
HIGGS 上深度 \(\ge 2\) 的 MLP 仍略强。若唯一目标是 log loss,没有理由换。换的理由是同一组参数同时给出形状保证和影响上界,而且放大 \(d\) 不会把解释通道弄丢。
对称特征值是 \(O(d^3)\),没有只求单个特征对的自定义核,特征一多这就是硬成本。实验只测了中间特征值,凸/凹两个端点的可学习性没有同等规模验证。多个半定矩阵的参数化几乎没摸,单调实验基本是「最后一个特征、对角且非负」。
真实数据只有 Criteo 和 HIGGS。特征影响上界随 \(d\) 变松,大矩阵上系数可读性会稀释。构造本身已在 PMM 框架里,这篇的贡献是当成可训练原语,配上初始化、形状控制和缩放实验。初始化启发式假设特征大致标准化、幅度很少超过 5,分布一偏就可能踩到小 gap。