新论文:从 SGD 与线性注意力对偶性导出全新学习范式

HanGuo97 · x · 2026-10-11

与 Google PI 合作的论文提出一个新视角:用梯度下降训练的线性层,其计算完全等价于「初始权重 + 对自身训练历史的线性注意力」——每个测试输入 attend 到训练期间的所有输入(keys)并重组关联存储的反向传播误差(values)。

基于这一对偶性,作者推导出一种新的学习范式:

作者称这一梯度下降与线性注意力的对偶关系虽曾被发现和 revisit,但至今仍鲜为人知,值得深入思考其对训练基础原理的含义。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →