Gated DeltaNet-2 获 cuDNN 官方支持,训练端到端提速约 3 倍
ZGojcic · x · 2026-08-24
NVIDIA cuDNN 团队为线性注意力架构 Gated DeltaNet-2(GDN-2) 提供了完整支持,不仅覆盖 prefill 前向,还包含基于 CUTLASS 原语高度优化的反向传播,已随 CUTLASS 4.7.0 发布。
在 GB300(BF16,batch 4,64 heads,d=128)上对比 FLA Triton 实现:前向最高快 6.4 倍,反向最高 2.8 倍,端到端训练约 3 倍提速;且从 2K 到 32K 序列长度吞吐保持平稳,说明内核达到了应有的 compute-bound 状态。
配套论文《Gated DeltaNet-2: Decoupling Erase and Write in Linear Attention》提出用通道级 erase gate 与 write gate 解耦线性注意力中「擦除」与「写入」的标量耦合,泛化了 Gated DeltaNet 与 Kimi Delta Attention(KDA);在 1.3B 参数、100B FineWeb-Edu token 训练下,语言建模等任务整体强于 Mamba-2、GDN、KDA 与 Mamba-3 变体。
「Infra」频道最新
- 富国银行:博通 FY28 AI 芯片营收将达 2053 亿美元 — Beth_Kindig · 2026-08-24
- Disaggregated LPDDR 内存:AI 算力基础设施的新解法 — jwt0625 · 2026-08-24
- 投机解码学习笔记:draft-and-verify 如何无损加速 LLM 推理 — helloiamleonie · 2026-08-24
- AI芯片全球电力需求暴增1100%,美国独占六成 — KyeGomezB · 2026-08-24
- 3080显存超频至+1200,Flux生图效率实测提升 — MakionGarvinus · 2026-08-24
- 开源平台xyOps集成调度、自动化与监控三大功能 — tom_doerr · 2026-08-24