腾讯提出 HiLS Attention:长文本外推提升 64 倍,推理最高加速 15.7 倍

jiqizhixin · x · 2026-07-30

腾讯 HY Team 提出了一种名为 HiLS Attention(分层稀疏注意力)的新机制,旨在解决大模型处理超长上下文时显存和算力消耗过大的问题。

该机制引导模型仅聚焦于关键文本块。实验表明,在短文本任务上它能达到与全注意力(full attention)相当的效果;而在长文本处理上,它不仅能将上下文外推能力提升 64 倍,还能带来最高 15.7 倍的推理速度提升,有望成为长上下文 AI 的重要突破。

原文链接 →

「模型」频道最新

更多「模型」频道 AI 资讯 →