QSA 注意力机制实测:语言建模更优且高效

nrehiew_ · x · 2026-08-27

经过在短上下文、长上下文及通用 LM 评估上的大量消融实验,QSA(Quasi-Sparse Attention)在语言建模任务上表现优于基线(假设 FLOPs 匹配),在 RULER 评测上基本持平。在效率方面,QSA 明显更优,且不影响 MTP(Multi-Token Prediction)的接受度。

所属事件:QSA 注意力与 GatedResidual 实测性能双双超越基线(2 条相关)→

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →