研究揭示混合线性注意力大模型计算机制与大规模激活

新论文剖析混合线性注意力大语言模型的内部机制:计算主要围绕昂贵的全注意力层展开,线性注意力层并非以低成本复用计算,而是积累并向全注意力层传递信息。研究还发现其中的大规模激活呈预注意力尖峰与尖峰间平台特征,并在接近全注意力层时发生变化。

2026-08-14 ~ 2026-08-15 · 2 条相关