字节等提出 DLA:动态线性注意力破解长上下文成本瓶颈
burkov · x · 2026-08-14
长上下文模型面临标准 Transformer 注意力机制计算成本高,而廉价的线性注意力因固定压缩策略易丢失细节的权衡难题。字节跳动联合俄亥俄州立大学和密歇根大学提出了动态线性注意力(DLA)。
该方法的核心机制包括:
- 基于输入的动态压缩:根据新 token 对当前记忆的改变程度来决定保留状态。
- 细粒度保留:在信息变化较大的区域保留更精细的状态,合并重复片段。
- 可控内存:合并低信息密度的相邻状态以限制总状态数,确保内存使用可预测。
在 16 个推理、检索和长上下文数据集上的实验表明,DLA 的表现持续优于固定调度的 Log-Linear 等基线方法。
「研究」频道最新
- 杜克、Meta与普林斯顿推出 PAHF 框架 — burkov · 2026-08-14
- 研究者提醒:勿用井字棋做小模型强化学习基准,易陷入格式合规陷阱 — cephaloform · 2026-08-14
- 《调试的艺术》更新:高效诊断 PyTorch NCCL 集合通信挂起问题 — StasBekman · 2026-08-14
- ICML论文揭示大模型记忆瓶颈:95%事实已学会,却有三成取不出 — 新智元 · 2026-08-14
- 当 LLM 分配真实资源时,它们遵循什么隐性偏好? — xuanalogue · 2026-08-14
- 初创公司推出「人脑细胞」算力替代方案 — ycombinator · 2026-08-14