Gated DeltaNet-2 获 cuDNN 官方支持,训练端到端提速约 3 倍

ZGojcic · x · 2026-08-24

NVIDIA cuDNN 团队为线性注意力架构 Gated DeltaNet-2(GDN-2) 提供了完整支持,不仅覆盖 prefill 前向,还包含基于 CUTLASS 原语高度优化的反向传播,已随 CUTLASS 4.7.0 发布。

在 GB300(BF16,batch 4,64 heads,d=128)上对比 FLA Triton 实现:前向最高快 6.4 倍,反向最高 2.8 倍,端到端训练约 3 倍提速;且从 2K 到 32K 序列长度吞吐保持平稳,说明内核达到了应有的 compute-bound 状态。

配套论文《Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention》提出用通道级 erase gate 与 write gate 解耦线性注意力中「擦除」与「写入」的标量耦合,泛化了 Gated DeltaNet 与 Kimi Delta Attention(KDA);在 1.3B 参数、100B FineWeb-Edu token 训练下,语言建模等任务整体强于 Mamba-2、GDN、KDA 与 Mamba-3 变体。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →