HiLS-Attention 7B 发布

pmttyji · reddit · 2026-07-10

Hugging Face 上发布了 **Tencent/HiLS-Attention-7B**,对应论文《**Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling**》。这是一个基于 **OLMo3-7B** 的继续训练 checkpoint,主打长上下文高效建模。 论文提出的核心思路是: - 传统 block sparse attention 需要先算完整的 chunk mass,代价高; - HiLS-Attention 使用 **compressed chunk keys** 估计 chunk 质量; - 再把注意力分解为 **chunk 间** 与 **chunk 内** 两级 softmax; - 使得稀疏注意力可以在 **next-token prediction loss** 下端到端学习。 仓库还说明这是一个 **pretrained base model**,未做对齐或安全微调,可能包含偏差并输出不安全内容。

所属事件:腾讯发布HiLS-Attention稀疏注意力模型(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →