NVIDIA提出SparDA架构:解码提速1.7倍,长文本推理更准
HankYeomans · x · 2026-08-13
NVIDIA 研究团队提出了名为 SparDA(Sparse Decoupled Attention)的新型 Transformer 架构,旨在解决长上下文大模型推理的瓶颈。
核心改进与效果:
- 解码速度提升 1.7 倍,长文本推理准确度提高 6.5 个百分点。
- 传统 Sparse attention 虽然减少了计算量,但 KV cache 仍随序列长度增长,导致显存溢出并引发 PCIe 传输瓶颈;且稀疏选择步骤本身仍保持 $O(T^2)$ 复杂度。
- SparDA 在传统的 Q、K、V 投影之外,引入了第四个投影层 Forecast。它能预测下一层所需的 KV 块,实现前瞻选择,从而让 CPU 到 GPU 的预取与当前层的执行重叠进行。
工程细节:
- 该机制与注意力查询解耦,在 GQA 实现中每个 GQA 组仅使用一个 Forecast head,降低了选择开销。
- 仅增加不到 0.5% 的参数量,且只需训练 Forecast 投影层即可匹配原始选择器的注意力分布。
「Infra」频道最新
- 联想 AI 硬件业绩大爆发,创纪录营收带动戴尔盘前上涨 — firstadopter · 2026-08-13
- 多模型协同成趋势,模型层低毛利将推高 AI 算力需求 — GavinSBaker · 2026-08-13
- 受AI芯片需求拉动,中芯国际利润暴增超两倍 — pstAsiatech · 2026-08-13
- 英伟达与云巨头博弈:谁将主导AI算力价值链? — RihardJarc · 2026-08-13
- 长鑫存储市值反超腾讯,AI 热潮催生存储芯片狂欢 — pstAsiatech · 2026-08-13
- NPU 正被植入监控摄像头,端侧 AI 视觉加速普及 — zephyr_z9 · 2026-08-13