腾讯混元开源HiLS稀疏注意力架构
机器之心 · wechat · 2026-07-20
腾讯混元团队开源了全新的分层地标稀疏注意力架构 HiLS-Attention,通过数学与架构创新,首次同时解决了传统稀疏注意力“表达力不足”和“端到端不可导”两大痛点,打破了效率与性能无法兼得的困境。
现有痛点:传统分块稀疏注意力常采用均值或最大值池化来估计数据块重要性,但这在数学上存在系统性偏差;而引入参数化摘要的方法,又因离散的 Top-K 选择操作切断了梯度反传,导致模型无法端到端优化选择过程。
HiLS 架构创新:
- 可导的评分函数:利用一阶泰勒展开,将数据块重要性近似为“相关项+熵偏置”,自适应统一了均匀与集中两种极端分布。
- 打通梯度断点:将注意力权重分解为“块内”和“块间”两级 Softmax,让代理质量直接参与前向计算,使语言建模 Loss 的梯度能直接指导模型学习如何选块。
实验效果:在 345M 至 7B 模型上验证,短文本性能与全注意力几乎持平;仅用 8K 上下文训练,即可免训外推至 4M 长度;在 512K 上下文下,prefill 和 decode 分别加速 13.5 倍和 15.7 倍。此外,得益于压缩去噪效应,该模型在部分长文本检索任务上甚至反超了全注意力机制。
「模型」频道最新
- Gemini 3.6 Flash 上线 Google AI Studio,输出更便宜 — gaganghotra_ · 2026-07-21
- Jack Clark 称 OpenAI 公开安全笔记有助前沿社区 — jackclarkSF · 2026-07-21
- Mindlab Research 将 Macaron-V1-Venti 发布到 Hugging Face — External_Mood4719 · 2026-07-21
- Google 在 AI Studio 里放出 Gemini 3.5 Flash-Lite 和 3.6 Flash — Expensive_Syrup_6529 · 2026-07-21
- ChatGPT 常先讲结构原理,却没先回答墙是否倾斜 — Aware-sky-3489 · 2026-07-21
- Grok 网站流量同比增长 38.15%,Q2 达 7.36 亿次 — XFreeze · 2026-07-21