Fast Weight Attention for Continual Learning
Yifan Zhang, Steve Ta, Jasper Zhang, Jichen Feng, Shuzhen Li, Yongxin Zhang, Yifeng Liu, Huizhuo Yuan, Mengdi Wang, Quanquan Gu, Andrew Chi-Chih Yao
cs.LG, cs.CL, stat.ML
2026-08-28
循环快权重的正确训练对是前一时刻key特征与当前value。Falcon在1.3亿参数上与Gated DeltaNet打平,可变位数加法外推均值到87.2%。
Transformer 的 KV cache 随长度涨。Mamba、线性注意力、DeltaNet 把历史压进固定大小的循环状态,每一步的状态更新就是一条在线学习规则。规则写的是哪一对特征和目标,往往被随手定成「当前 key 配当前 value」。在先写后读、下一步预测的语义下,这一对其实对不上:模型用已经写完的状态去预测下一个 token 时,当时手里的写特征是 ϕ(k{t-1}),新看到的目标才是 vt。同一时刻的 (ϕ(kt), vt) 仍然因果,但优化的是另一套内部目标。
循环序列模型在这里被当成持续学习:固定容量的快记忆必须在线绑定新证据,还不能把旧的冲掉。对齐错了,后面的塑性、遗忘、滑窗排练都会在错误的样本上走梯度。
Falcon 把状态 S 当成线性预测器:用 xt=ϕ(k{t-1}) 预测 yt=vt,再对瞬时岭回归做一步归一化梯度。步长 ηt = βt / (||xt||² + λt + ε),这是自适应滤波里的 NLMS,对特征尺度不那么脆。残差 rt = vt − S{t-1}^T xt 量的是「前一写特征对当前 value 的预测误差」,不是标准 DeltaNet 里当前 key 对当前 value 的重构误差。
六个变体按两个轴排:
Falcon-1 是标量 NLMS;Falcon-2 把 η 扩成向量;Falcon-3 在窗口上做小批量,平滑常数改成窗口协方差的最大特征值。A 系列去掉残差,直接写 η xt yt^T。读一律是 ot = St^T ϕ(qt)。默认对 Q/K 做 RMSNorm,比常见的 ℓ2 归一在混合精度下更稳。循环扫描、带掩码并行、SSD 风格的 chunk 并行三种形式都给了,衰减用正数 renormalization,避免 log 空间里的负衰减。
124M 到 130M 参数,FineWeb-Edu 上约 492 亿 token,序列长度 1024。对照是 LLaMA 风格 Transformer、RetNet、Mamba-2、DeltaNet、Gated DeltaNet。主表只报了标量回归 Falcon-1.3 和若干内积变体;Falcon-2、Falcon-2A、Falcon-3 定义了但没有单独出数。
| 方法 | FineEdu PPL↓ | 0-shot 均值 | 加法外推均值 | Acc@48 位 |
| Transformer | 17.38 | 48.16 | 65.8 | 49.0 |
| Gated DeltaNet | 17.32 | 48.78 | — | — |
| RetNet | 18.79 | 48.05 | 82.9 | 63.0 |
| Mamba-2 | 17.70 | 48.80 | 75.2 | 51.0 |
| Falcon-1.3 | 17.10 | 49.18 | 68.8 | 48.0 |
| Falcon-1A.2 | 17.70 | 49.30 | 85.2 | 63.0 |
| Falcon-1A.3 | 17.40 | 48.95 | 85.9 | 69.0 |
| Falcon-3A.3 | — | 49.00 | 87.2 | 69.0 |
语言建模没有全面碾压。FineEdu 上 Falcon-1.3 的 17.10 略优于 Gated DeltaNet 的 17.32;Wiki 上同一模型是 33.00,仍差 Gated DeltaNet 的 30.99。0-shot 均值最高的是 Falcon-1A.2 的 49.30。可变位数加法把存储和进位外推隔离得更干净:训练 1 到 32 位,测 33 到 48 位,Falcon-3A.3 均值 87.2,Transformer 只有 65.8。回归变体 Falcon-1.3 在加法上掉到 68.8,几乎回到 Transformer 档。论文把这项实验定位为支持证据,不是主结果。
给 SSM 和快权重一条很具体的施工图:时间对齐、塑性、遗忘、有界排练可以拆开调。对齐从「当前绑当前」改成「前一特征预测当前目标」,更新公式几乎还是 DeltaNet,只挪了一个下标。chunk 并行还在,训练成本档位没换。
做长上下文循环模型时,先检查 write 规则绑的是不是预测时真正可见的特征。语言建模上这是渐进改进;加法外推上,内积加滑窗的组合差出一截。两套目标不要混着吹。
主表只跑了约 1.3 亿参数、500 亿 token,没有 1B 以上对照。Falcon-2、Falcon-2A、Falcon-3 写进了公式,没有单独基准。加法任务报的是 teacher-forced 后缀准确率,不是自由生成。Wiki 上 Gated DeltaNet 仍明显更低困惑度,框架没有证明「换对齐就能赢通用语言建模」。同一时刻配对仍然合法,文中也没有把两种对齐在完全锁死的其余设置下做到大模型。正衰减 renormalization、边界 x1=0 这些实现细节对复现很关键,附录很长,主文读起来会低估工程量。