仅保留4个首token+64token窗口,免训练匹敌线性注意力模型
burny_tech · x · 2026-09-14
作者发帖称,业界花费数百万美元将 LLM 后训练成线性注意力以消除 KV cache 瓶颈,但一项反直觉发现是:完全不训练,仅保留序列开头的 4 个 token 加上一个 64-token 的滑动窗口,就能在几乎所有 benchmark 上匹敌甚至超过蒸馏出的线性注意力模型。
这暗示之前那些模型从线性化中获益,很大程度上来自「保留初始 token」这一简单机制(类似 attention sink 效应),而非复杂的蒸馏训练本身。若成立,可能意味着部分 KV cache 优化工作存在更廉价的替代方案。详见原帖推文串。
「Infra」频道最新
- 新研究:LLM 强化学习训练可弃用 AdamW,标准 SGD 同样有效 — zhaoran_wang · 2026-09-14
- RTX 5090 现货几近断货,价格或将进一步失控 — DustNearby2848 · 2026-09-14
- OneLA 共享线性注意力状态,生成式推荐大束搜索解码提速 1.54-2.46 倍 — _reachsumit · 2026-09-14
- 优必选万台级人形机器人工厂投产,蔚山AI数据中心扩至900兆瓦 — 创业邦 · 2026-09-14
- 深度长文拆解 HBM:热梯度是堆叠式显存扩展的头号难题 — blaizedsouza · 2026-09-14
- Perplexity 推出 Hybrid Compute:任务在云端与 Mac 本地间分流 — Aiden_Tech_Ai · 2026-09-14