HLA 混合线性注意力:LongBench-V2 最高提升 5.57 分

Monash · hf · 2026-10-07

Monash 团队提出 Hybrid Linear Attention(HLA),一种针对 Gated DeltaNet 的查询依赖块级注意力机制,解决线性注意力把历史压缩成循环状态后难以选择性访问稀疏远距离信息的问题。

方法要点:

实验:在 Qwen3.5 0.8B-9B 模型上(预训练适配与从头训练两种设置),HLA 一致优于原生 GDN 和固定 chunk 混合,LongBench-V2 最高提升 5.57 个百分点,RULER 提升 3.97 分;从头训练的 1.3B 模型(100B token、4K 上下文)上,RULER 增益随评估上下文从 4K 到 32K 递增(0.83→4.22 分),说明查询依赖的记忆组合在超出训练上下文时依然有效。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →