腾讯混元开源HiLS稀疏注意力架构

机器之心 · wechat · 2026-07-20

腾讯混元团队开源了全新的分层地标稀疏注意力架构 HiLS-Attention,通过数学与架构创新,首次同时解决了传统稀疏注意力“表达力不足”和“端到端不可导”两大痛点,打破了效率与性能无法兼得的困境。

现有痛点:传统分块稀疏注意力常采用均值或最大值池化来估计数据块重要性,但这在数学上存在系统性偏差;而引入参数化摘要的方法,又因离散的 Top-K 选择操作切断了梯度反传,导致模型无法端到端优化选择过程。

HiLS 架构创新:

实验效果:在 345M 至 7B 模型上验证,短文本性能与全注意力几乎持平;仅用 8K 上下文训练,即可免训外推至 4M 长度;在 512K 上下文下,prefill 和 decode 分别加速 13.5 倍和 15.7 倍。此外,得益于压缩去噪效应,该模型在部分长文本检索任务上甚至反超了全注意力机制。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →