稀疏注意力进展迅猛,HISA 被指融合 DSA 与 NSA 优点
teortaxesTex · x · 2026-09-17
评论者 teortaxesTex 指出稀疏注意力领域正出现大量工作:在 DeepSeek 的 DSA(DeepSeek Sparse Attention)被验证有效后,百万级上下文可能只是开始。
他提到新论文中的 HISA 方法「轻松超越」了已有结果,认为 HISA 相当于 DSA 加上 NSA(Native Sparse Attention)的好想法,在极限情况下可将索引器成本降低一个数量级级别(按 B 计),并且即插即用。
「研究」频道最新
- 智能体时代科学如何交流?新文章以黎曼猜想为例提出设想 — tensorqt · 2026-09-17
- GPT-Policy:让 VLM 靠上下文学习直接驱动机器人,无需梯度更新 — Dongzhou Cheng · 2026-09-17
- Fathom 按查询自适应读位宽,百万 token KV 扫描提速 1.67 倍 — Vivek Kalyanarangan · 2026-09-17
- nnU-Net 跨脑肿瘤人群泛化评测:源域 Dice 0.906 骤降至 0.831 — Tristan Kirscher · 2026-09-17
- 单张 24GB 跑 35B MoE:SSD 流式推理引擎 Edge0 达 20 token/s — Edge0 · 2026-09-17
- LoRA 初始化一直被做错,SVD 初始化可加速 RL 训练收敛 — burny_tech · 2026-09-17