HLA 混合线性注意力:LongBench-V2 最高提升 5.57 分
Monash · hf · 2026-10-07
Monash 团队提出 Hybrid Linear Attention(HLA),一种针对 Gated DeltaNet 的查询依赖块级注意力机制,解决线性注意力把历史压缩成循环状态后难以选择性访问稀疏远距离信息的问题。
方法要点:
- 将每个已完成的 chunk 表示为精确仿射状态转移,从紧凑的自注意力池化代表计算内容相关路由门。
- 每个门在该 chunk 的历史转移与恒等映射之间插值,同时控制增量记忆和对更早状态的变换。
- 有效支持正则鼓励稀疏推理时路由集中。
实验:在 Qwen3.5 0.8B-9B 模型上(预训练适配与从头训练两种设置),HLA 一致优于原生 GDN 和固定 chunk 混合,LongBench-V2 最高提升 5.57 个百分点,RULER 提升 3.97 分;从头训练的 1.3B 模型(100B token、4K 上下文)上,RULER 增益随评估上下文从 4K 到 32K 递增(0.83→4.22 分),说明查询依赖的记忆组合在超出训练上下文时依然有效。
「研究」频道最新
- Fractal Frontier:AI 或将证明世界远比人类偏好更有序 — IgorCarron · 2026-10-07
- BVB 基准:让 Agent 用 Blender 程序化重建真实视频来检验理解力 — RexDouglass · 2026-10-07
- DeepMind 发布 AlphaProtein Novo,可从零设计全新酶催化自然界没有的反应 — Scobleizer · 2026-10-07
- 安全研究者翻出 2025 年演讲旧预测:竟提前命中 ExploitGym 及其问题 — moyix · 2026-10-07
- OpenAI 新数学仓库或夯实磁等离子体研究,候选成果瞄准 Vlasov-Maxwell 方程 — johnseach · 2026-10-07
- 数学外包给 OpenAI 后,经济学研究格局将如何重排 — RexDouglass · 2026-10-07