HiLS-Attention 7B 发布
pmttyji · reddit · 2026-07-10
Hugging Face 上发布了 **Tencent/HiLS-Attention-7B**,对应论文《**Hierarchical Sparse Attention Done Right: Toward Infinite Context Modeling**》。这是一个基于 **OLMo3-7B** 的继续训练 checkpoint,主打长上下文高效建模。 论文提出的核心思路是: - 传统 block sparse attention 需要先算完整的 chunk mass,代价高; - HiLS-Attention 使用 **compressed chunk keys** 估计 chunk 质量; - 再把注意力分解为 **chunk 间** 与 **chunk 内** 两级 softmax; - 使得稀疏注意力可以在 **next-token prediction loss** 下端到端学习。 仓库还说明这是一个 **pretrained base model**,未做对齐或安全微调,可能包含偏差并输出不安全内容。
所属事件:腾讯发布HiLS-Attention稀疏注意力模型(2 条相关)→
「Infra」频道最新
- 现货内存价飙升 140%,合约重定价开始滞后 — tengyanAI · 2026-07-21
- 有人把 AI 使用方式指向异步长周期实验而非单买算力 — voooooogel · 2026-07-21
- PrismML Bonsai 27B 量化后仅 3.8GB 可手机运行 — tony10000 · 2026-07-21
- 有人主张给模型独立 micro VM,少用 tool calling — joecole · 2026-07-21
- 把数据集打包成顺序 blob,训练吞吐提升 30% — irinarish · 2026-07-21
- 一个 C++20 CPU 原生 strict-W1 训练 runtime 寻求反馈 — Wonderful-Income7415 · 2026-07-21