训练后注意力算子近乎冻结、可整体缓存:PLDR-LLM 的完整形式化

Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference

Burc Gokden

cs.LG, cs.CL

2026-08-11

PLDR-LLM 用从输入学出的双线性算子替换点积注意力,训练后该算子对输入几乎不变(波动 10⁻⁶ 量级),整段深度生成网络可在推理时缓存替换。

这篇在解决什么

标准的缩放点积注意力(SDPA)用一个固定的双线性形式 QK^T/√d 把 query 和 key 对齐。Burc Gokden 从 2019 年的 CoulGAT 起,一路做到 2024 年的 PLDR-LLM,提出把这个固定形式本身换成一个从输入学出来的双线性算子,称为 Power Law Graph Attention(PLGA)。这篇(整个系列的第六篇)不提新模型、不刷榜单,只做一件事:把 PLDR-LLM 的每个部件写成可验证的定义,把支撑这个程序的三个核心发现(算子包含 SDPA、训练后算子近乎冻结、临界式训练)逐条钉死在它们真正成立的认知强度上,每个断言标成定理、条件定理、测量还是猜想,绝不混用。

这之所以是个真问题:输入相关的注意力算子(hypernetwork 一脉)做了很多年,但「训完之后这个算子到底变成了什么、能不能等价替换」一直没有干净的分析答案。这篇就是来补这个空缺的。

方法

PLGA 把打分用的双线性形式从常数变成一个学出来的算子,步骤是:

整套链路里 A、ALM、AP、GLM、ELM 这些中间张量被显式暴露出来,作者叫它们「演绎输出」(deductive),区别于真正用来预测下一个 token 的「归纳输出」V。一个 NOTEARS 形式的 DAG 正则项试图让 GLM 在 head 空间里趋近无环,但严格正定性恰好挡住了精确无环。

三个结构性结论:PLGA 在 GLM=I 时严格包含 SDPA;在 RoPE 的非共振条件下,一个交换子判据精确刻画了哪些插入算子能保住相对位置依赖;以及一条「推理坍缩定理」:如果演绎输出对输入完全不变,推理就退化成带常数算子的广义 SDPA。

结果

这里的「结果」不是 benchmark 胜负,而是在一个已发布 checkpoint 上量出来的结构性质:

指标数值
算子相对波动10⁻⁶ 10⁻¹¹
生成算子 A 数值秩1(满秩坍缩)
交互张量 ALM 数值秩中位数62.5 / 64
TruthfulQA mc2(block = sequential)0.3977
WikiText-2 blockwise CE = sequential NLL3.4794 nats/token

具体说:训完之后,生成算子 A 在奇异值容差下数值秩为 1,同一层各 head 的行彼此相同;ALM 虽然行列式浮点下为零,但数值秩接近满(中位 62.5/64),所谓「行列式为零」是下溢不是真的亏秩。算子 GLM 对输入变化的相对波动在 10⁻⁶ 到 10⁻¹¹,最好的模型在浮点分辨率下直接是 0,所以整段深度生成网络在推理时可以用一个缓存下来的常数算子替换,benchmark 表现不变。

8 个 zero-shot 任务(ARC-Easy/Challenge、HellaSwag、PIQA、Social-IQA、WinoGrande、TruthfulQA、OpenBookQA)各抽 100 条共 800 条,block 打分和 sequential 打分之间零次 argmax 翻转、零对不一致;TruthfulQA mc2 在 100 条均值上两协议差 8.5×10⁻¹⁰;WikiText-2 held-out 上 blockwise CE 和 sequential NLL 差 1.8×10⁻⁹。

要诚实:TruthfulQA mc2 约 0.40 是偏低的成绩(同任务上主流模型多在 0.5 上下或更高),说明被审计的 checkpoint 体量很小、属于实验性质。论文没有声称 PLGA 在任何基准上超过 SDPA。

为什么重要

对做注意力机制设计的人,这是一个干净的案例:一个超网络式的、输入相关的注意力算子,训完之后经验性地坍缩成一个几乎不变的常数算子,于是「训练时贵、推理时可缓存」。这种 collapse 现象把「学出来的动态算子」和「训完冻结的固定算子」之间的张力摆到了台面上:花了训练算力去学一个动态结构,它最后落点接近一个固定形式。

作者的认知纪律在这个口味的论文里少见:每条断言都标了认知强度,部分证明用 Lean 4 机器校验过,附录专门交代浮点敏感性。对想跟进「可缓存、可解释注意力」方向的人,这套形式化和审计脚本是有用的参考底座。

但它不是从业者的即插即用件:单作者、小 checkpoint、没有任何前沿规模的验证。

局限与存疑

作者自己把局限写得很显眼,这是这篇比一般架构论文靠谱的地方:包含 SDPA 不等于优于 SDPA,「在等资源下的严格函数类分离明确未被证明」;算子不变性是测量出的假设、不是定理;扰动界「不能认证缓存推理,组装出来的代理够不到解码边界」;自组织临界只是唯象框架、不是已确立的结果;不少定理条件化在未对真实模型验证过的 Lipschitz 或平稳性假设上;审计范围只有一个 checkpoint、八条提示、一套软件栈,跨 seed、规模、数据集的外推都不成立;幂律阶段下游局部放大可达 10¹⁰,数值随软硬件配置漂移。

读下来最要紧的一处存疑:核心实用卖点(缓存算子换推理加速)依赖不变性在更大规模上仍然成立,而这恰恰没测过;TruthfulQA 偏低,也无法判断 collapse 在规模上去到底是帮忙还是帮倒忙。整个程序是单作者,真正影响结论的那几条定理都还挂在前提没被验证的假设上。

术语

原文与代码

相关论文

全部论文解读