BAAI CoWA 注意力架构:全因果覆盖改为集体属性,训练延迟降 7.4 倍
BAAI · hf · 2026-09-29
全注意力让每个头重复暴露于完整因果历史,即便有 IO 高效稠密核也造成大量冗余计算与访存。BAAI 提出 CoWA:把对因果历史的访问分配到各 KV 头上,所有头共享近对角与前缀 sink 窗口,互补的长程窗口分区剩余历史;各头并集提供完整因果覆盖,无需可学习路由器或索引器,训练推理一致,且兼容 KV 头张量并行。
8K 窗口匹配消融显示,100% 集体覆盖的 CoWA 达 89.73% 精度,接近 FullAttn 的 89.97%,而重复长程窗口明显更差;在匹配 token 预算的联想记忆对比中,CoWA 随上下文增长紧贴 FullAttn,其他稀疏模式损失明显。
在 128K 注意力算子基准上,CoWA 使训练前向/反向延迟分别降低 7.4 倍和 8.6 倍,推理解码延迟降低 3.0 倍,解码峰值算子内存低 7.6 倍。0.6B 到 14B 缩放律训练中困惑度紧贴 FullAttn 且总训练 FLOPs 更低;继续训练得到的 32B 模型在知识、推理与长上下文检索上与 FullAttn 相当。结论:全因果覆盖可以是头集合的集体属性,而非每个头的重复属性。
「Infra」频道最新
- SemiAnalysis 拆解 GLM-5.3:稀疏注意力为何没能省下 HBM 内存 — burny_tech · 2026-09-29
- 蒙特利尔 Exploit Summit 亮点:Bittensor 生态大版图一览 — markjeffrey · 2026-09-29
- Bain 测算:AI 到 2031 年需年入 6 万亿美元才能撑住算力建设 — sanjaykalra · 2026-09-29
- 实测打脸:DGX Spark 上 bf16 反而比 int8 convrot 更快,H3 视频生成差 14 秒 — dtdisapointingresult · 2026-09-29
- BAAI 推出 MALA 注意力:128K 上下文训练延迟降 2.2 倍 — BAAI · 2026-09-29
- Databricks 用 AI 智能体登顶 NVIDIA 内核榜单,总花费仅约 7 万美元 — Yuchenj_UW · 2026-09-29