ALHR 稀疏注意力:每查询仅读 30 个键,KV 压缩 35 倍保住准确率
Alarming-Emotion-894 · reddit · 2026-10-09
开发者发布 ALHR(Adaptive Learnable Hierarchical Routing),一种基于二叉树的稀疏注意力系统,实现亚二次推理复杂度同时保持准确率。
方法
- 用静态二叉树加可学习路由函数,最小化每个查询需要读取的 key 数量;训练第一阶段仍使用 dense teacher。
MQAR 测试(1024 tokens)
- 每查询平均读取 key 数:dense 512 个 vs ALHR 30 个。
- Top-1 准确率:dense 94.9% vs ALHR 92.1%。
- KV 压缩:ALHR 达 35.3 倍(仅读 2.83%),缓存压缩 100%。
- 峰值显存:dense 57MB(二次增长)vs ALHR 422MB(线性增长)。
局限:训练仍是二次复杂度,推理为 N log N;全规模测试尚未完成。代码与日志开源于 GitHub。
所属事件:ALHR 稀疏注意力:二叉树路由实现 O(NlogN) 长上下文推理(2 条相关)→
「研究」频道最新
- 论文:LLM 在医学诊断中太「顺从」,谄媚导致诊断不稳定 — lulzxdxdxd · 2026-10-11
- AI 数据银河系漫游指南:RL 环境、rollout 等 10 个术语一文讲透 — geoffwolfe · 2026-10-11
- 福尔摩斯侦探游戏实测:小模型蜂群+强推理者破案率 96% — No_Yogurtcloset_7050 · 2026-10-11
- 开源 NSFW 内容分类器 Blue-Eye 号称超越 Google 与 AWS,成本仅零头 — Mundane_Toe_8074 · 2026-10-11
- Internalizer 超网络为 284B 大模型一键生成文档级 LoRA 适配器 — teortaxesTex · 2026-10-11
- 开发者用自研框架训练 9B Qwen3.5 基座模型生成 SVG — cephaloform · 2026-10-11