仅保留4个首token+64token窗口,免训练匹敌线性注意力模型

burny_tech · x · 2026-09-14

作者发帖称,业界花费数百万美元将 LLM 后训练成线性注意力以消除 KV cache 瓶颈,但一项反直觉发现是:完全不训练,仅保留序列开头的 4 个 token 加上一个 64-token 的滑动窗口,就能在几乎所有 benchmark 上匹敌甚至超过蒸馏出的线性注意力模型。

这暗示之前那些模型从线性化中获益,很大程度上来自「保留初始 token」这一简单机制(类似 attention sink 效应),而非复杂的蒸馏训练本身。若成立,可能意味着部分 KV cache 优化工作存在更廉价的替代方案。详见原帖推文串。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →