字节等提出 DLA:动态线性注意力破解长上下文成本瓶颈

burkov · x · 2026-08-14

长上下文模型面临标准 Transformer 注意力机制计算成本高,而廉价的线性注意力因固定压缩策略易丢失细节的权衡难题。字节跳动联合俄亥俄州立大学和密歇根大学提出了动态线性注意力(DLA)。

该方法的核心机制包括:

在 16 个推理、检索和长上下文数据集上的实验表明,DLA 的表现持续优于固定调度的 Log-Linear 等基线方法。

原文链接 →

「研究」频道最新

更多「研究」频道 AI 资讯 →