新论文:从 SGD 与线性注意力对偶性导出全新学习范式
HanGuo97 · x · 2026-10-11
与 Google PI 合作的论文提出一个新视角:用梯度下降训练的线性层,其计算完全等价于「初始权重 + 对自身训练历史的线性注意力」——每个测试输入 attend 到训练期间的所有输入(keys)并重组关联存储的反向传播误差(values)。
基于这一对偶性,作者推导出一种新的学习范式:
- 不再每一步都用梯度下降更新线性层
- 而是维护一个不断增长的梯度信号「KV cache」,对其做注意力
- 神经网络在训练过程中随之「生长」
作者称这一梯度下降与线性注意力的对偶关系虽曾被发现和 revisit,但至今仍鲜为人知,值得深入思考其对训练基础原理的含义。
「研究」频道最新
- 26 模型 228 任务:METR 时间视界曲线 2-30 分钟段近乎平坦 — lulzxdxdxd · 2026-10-11
- mtDIVE 预印本发布:解析数千个线粒体 DNA 变异的功能影响 — manorlaboratory · 2026-10-11
- CSCW 论文分析 1800+ Mastodon 实例:仅 20% 公开屏蔽列表且少有说明 — manoelribeiro · 2026-10-11
- 烧掉 5000 亿 token,让 AI Agent 反编译一款第一人称射击游戏 — davikr · 2026-10-11
- AI 证明被数学家称「外星数学」:正确但不似人类思维 — imjustnewatai · 2026-10-11
- Strogatz 谈 AI 求解数学:决定哪些问题值得解仍是人类的事 — stevenstrogatz · 2026-10-11