BAAI CoWA 注意力架构:全因果覆盖改为集体属性,训练延迟降 7.4 倍

BAAI · hf · 2026-09-29

全注意力让每个头重复暴露于完整因果历史,即便有 IO 高效稠密核也造成大量冗余计算与访存。BAAI 提出 CoWA:把对因果历史的访问分配到各 KV 头上,所有头共享近对角与前缀 sink 窗口,互补的长程窗口分区剩余历史;各头并集提供完整因果覆盖,无需可学习路由器或索引器,训练推理一致,且兼容 KV 头张量并行。

8K 窗口匹配消融显示,100% 集体覆盖的 CoWA 达 89.73% 精度,接近 FullAttn 的 89.97%,而重复长程窗口明显更差;在匹配 token 预算的联想记忆对比中,CoWA 随上下文增长紧贴 FullAttn,其他稀疏模式损失明显。

在 128K 注意力算子基准上,CoWA 使训练前向/反向延迟分别降低 7.4 倍和 8.6 倍,推理解码延迟降低 3.0 倍,解码峰值算子内存低 7.6 倍。0.6B 到 14B 缩放律训练中困惑度紧贴 FullAttn 且总训练 FLOPs 更低;继续训练得到的 32B 模型在知识、推理与长上下文检索上与 FullAttn 相当。结论:全因果覆盖可以是头集合的集体属性,而非每个头的重复属性。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →