Gated DeltaNet-2 中稿 NeurIPS,混合线性注意力模型新 SOTA

AccBalanced · x · 2026-09-25

NVIDIA 研究者 Ali Hatamizadeh 等的 Gated DeltaNet-2 论文被 NeurIPS 2026 接收,作者称其成为混合/线性注意力模型的新的 SOTA。

核心思想:线性注意力用固定大小的循环状态替代 softmax 注意力的无限增长缓存,但难点在于如何编辑压缩记忆而不破坏已有关联。现有 delta-rule 模型(Gated DeltaNet、Kimi Delta Attention/KDA)用单一标量门同时控制两件事:擦除多少旧内容、写入多少新内容。

方法:Gated DeltaNet-2 将两者解耦,引入通道级擦除门 bt 和写入门 wt,同时继承自适应遗忘与通道级衰减;当两个门退化为同一标量时即还原为 KDA,进一步退化为 Gated DeltaNet。论文推导了 fast-weight 更新视角、chunkwise WY 算法与保持高效并行训练的 gate-aware 反向传播。

实验:在 100B FineWeb-Edu token 上训练的 1.3B 模型,在语言建模等任务上全面超越 Mamba-2、Gated DeltaNet、KDA 与 Mamba-3 变体。论文与代码均已公开。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →