Gated DeltaNet-2 中稿 NeurIPS,混合线性注意力模型新 SOTA
AccBalanced · x · 2026-09-25
NVIDIA 研究者 Ali Hatamizadeh 等的 Gated DeltaNet-2 论文被 NeurIPS 2026 接收,作者称其成为混合/线性注意力模型的新的 SOTA。
核心思想:线性注意力用固定大小的循环状态替代 softmax 注意力的无限增长缓存,但难点在于如何编辑压缩记忆而不破坏已有关联。现有 delta-rule 模型(Gated DeltaNet、Kimi Delta Attention/KDA)用单一标量门同时控制两件事:擦除多少旧内容、写入多少新内容。
方法:Gated DeltaNet-2 将两者解耦,引入通道级擦除门 bt 和写入门 wt,同时继承自适应遗忘与通道级衰减;当两个门退化为同一标量时即还原为 KDA,进一步退化为 Gated DeltaNet。论文推导了 fast-weight 更新视角、chunkwise WY 算法与保持高效并行训练的 gate-aware 反向传播。
实验:在 100B FineWeb-Edu token 上训练的 1.3B 模型,在语言建模等任务上全面超越 Mamba-2、Gated DeltaNet、KDA 与 Mamba-3 变体。论文与代码均已公开。
「模型」频道最新
- 提出用 Jev 类系统一模型打造 Bittensor 验证者的廉价决策层 — markjeffrey · 2026-09-25
- Claude 主动识别 bug、打包日志并请求用户提交报告 — ColleenMBrady · 2026-09-25
- Meta Muse 运行时可导出系统数据,研究者轻松拿到完整上下文 — sn2006gy · 2026-09-25
- GPT-6 Luna 隐藏开关:Codex 中手动开启 Max 推理 — daniel_mac8 · 2026-09-25
- NVIDIA 开源 Cascade RL 获 NeurIPS Oral,IOI 银牌超越 DeepSeek-R1 — _weiping · 2026-09-25
- 本地开源模型实测求推荐:社区都在用什么替代闭源 AI — LearnNTeachNLove · 2026-09-25