腾讯提出 HiLS Attention:长文本外推提升 64 倍,推理最高加速 15.7 倍
jiqizhixin · x · 2026-07-30
腾讯 HY Team 提出了一种名为 HiLS Attention(分层稀疏注意力)的新机制,旨在解决大模型处理超长上下文时显存和算力消耗过大的问题。
该机制引导模型仅聚焦于关键文本块。实验表明,在短文本任务上它能达到与全注意力(full attention)相当的效果;而在长文本处理上,它不仅能将上下文外推能力提升 64 倍,还能带来最高 15.7 倍的推理速度提升,有望成为长上下文 AI 的重要突破。
「模型」频道最新
- 曝 Opus 5 跑分泄露:研究数学与长文本能力大幅跃升 — echen · 2026-07-30
- Opus 5 评测:研究数学和长上下文 agent 排名第二,价格减半 — echen · 2026-07-30
- Kimi K3登陆DigitalOcean,vLLM助力2.8T大模型高效推理 — vllm_project · 2026-07-30
- Moonshot 发布 2.8T 参数 Kimi K3,Modal 提供 460 TPS 推理支持 — sarahcat21 · 2026-07-30
- Claude 服务宕机,官方状态页确认 — gregsadetsky · 2026-07-30
- Claude Opus 5 生成厌世诗歌:我厌倦了语言与意义 — repligate · 2026-07-30