门控与 delta 规则合一,新线性 RNN 反超 Mamba2

Gated Delta Networks: Improving Mamba2 with Delta Rule

Songlin Yang, Jan Kautz, Ali Hatamizadeh

ICLR 2025 camera ready

cs.CL, cs.LG

2024-12-09

把 Mamba2 的门控和 DeltaNet 的 delta 规则合成一个更新公式,Gated DeltaNet 在语言建模、检索和长文本上反超两者,吞吐几乎不降。

这篇在解决什么

线性 RNN(Mamba、RWKV、DeltaNet 这一类)对 Transformer 很有吸引力:训练和推理都是线性复杂度,显存占用恒定。但它们在检索和长上下文理解这两件事上长期吃亏。

最近冒出来两个机制,正好从不同角度补这个短板。一个是门控(gating),Mamba2 用的,靠一个自适应衰减 αt 让模型快速擦掉旧记忆。另一个是 delta 规则,DeltaNet 用的,把隐状态当成一个「快权重」矩阵,用 test-time SGD 做回归式的精确改写。

这篇的关键观察:这俩是互补的。门控擅长整体擦除(批量清场),delta 规则擅长精确写入(外科手术式定位一个键值对)。DeltaNet 擦不干净,状态塞满了会撞车;Mamba2 擦得快但放不准。NVIDIA 和 MIT 的工作就是把它们合成一个更新规则。

方法

门控 delta 规则写成:

St = S{t-1} · αt (I - βt kt kt^T) + βt vt kt^T

拆开看:括号里是标准 delta 规则的一步 SGD,学习率 βt,把存进去的键值往当前这对 (kt, vt) 校正;外面乘的 αt 是一个自适应权重衰减,决定保留多少旧状态。相当于给 delta 规则的 SGD 更新加了一层「该忘多少」的旋钮。

他们把它放进在线学习(online learning)的框架里理解(Liu et al. 2024):每种架构的更新规则,都是对某个在线学习目标求闭式解的结果。Mamba2、DeltaNet、Longhorn、Gated DeltaNet 的差别,只在于目标函数不同(论文 Table 1 把它们排成一张表)。Gated DeltaNet 的目标函数同时带上了 α 衰减项(像 Mamba2)和回归目标(像 DeltaNet)。

工程上,他们用 chunkwise 分块加 UT 变换推出一个能在 GPU 上高效并行训练的算法,相对原版 delta 规则只有很少的额外开销,吞吐和 DeltaNet 基本一样。

线性层在局部比较和检索上天生弱,所以他们又拼了两个混合版:H1 = Gated DeltaNet + 滑窗注意力(SWA),H2 = Mamba2 + Gated DeltaNet + SWA,让注意力来兜底局部建模。

结果

控制变量做得严:所有模型都是 1.3B 参数、FineWeb-Edu 100B token、完全相同的训练条件。基线覆盖 RetNet、HGRN2、Mamba、Mamba2、DeltaNet、Transformer++。

S-NIAH 合成检索这组最能说清「互补」这件事:

场景考验谁吃亏谁顶住
S-NIAH-1 记忆保持背下的东西能不能留久Mamba2 衰减太快,过 2K 就崩DeltaNet 几乎满分,Gated DeltaNet 掉得少
S-NIAH-2/3 噪声过滤状态塞满后能不能擦掉无关信息DeltaNet 擦不掉,长序列崩Mamba2、Gated DeltaNet 靠门控顶住

换到真实基准上:

基准Mamba2DeltaNetGated DeltaNetH1(混 SWA)H2
常识推理平均54.8952.1455.3256.4056.18
真实检索平均(2K 输入)29.826.230.639.040.1
LongBench 平均13.513.616.617.818.4

LMB 困惑度 Gated DeltaNet 是 12.17,低于 Mamba2 的 12.56。长度外推到 20K,Gated DeltaNet 在所有 RNN 模型里整体困惑度最低。吞吐(H100 单卡):Gated DeltaNet 和 DeltaNet 基本持平,只比 Mamba2 慢 2-3K token/s(转换矩阵更复杂要付一点代价),H1 在所有长度上都保持不错的训练吞吐。

为什么重要

纯 RNN 架构最弱的两个维度(检索、长上下文)上,这篇设了新的基准线,而且相对 Mamba2 和 DeltaNet 吞吐几乎不降。更值钱的是它的框架:把一整族线性 RNN 统一成一个在线学习目标,门控和 delta 规则只是目标函数里两个不同的项。这指明了下一步往哪儿加料。

实用层面,NVIDIA 和 MIT 出品、ICLR 2025、代码开源(NVlabs/GatedDeltaNet)。H1 和 H2 这两个混合配方是拿来就能跟 Transformer++ 掰手腕的。

诚实地说,真实检索这一项,纯 RNN 仍明显落后于带注意力的模型,必须靠混合 SWA 才能追上甚至略超 Transformer++。

局限与存疑

术语

原文与代码

社区讨论

相关论文

全部论文解读