滑动窗口注意力+Attention Sinks 免训练击败线性注意力

Alexia Jolicoeur-Martineau 等人发布新论文,提出一个反直觉结论:在预训练的 softmax Transformer 上,只需把注意力后验修改为带 attention sinks 的滑动窗口注意力(SWA)掩码,零训练成本,性能即可优于将模型强行适配为线性注意力(Linear Attention)再进行后训练微调的方案。

已确认

为什么重要

2026-08-31 ~ 2026-08-31 · 5 条相关

一手来源

另有 1 条近重复转述:jm_alexia