长短滑窗注意力让长上下文训练每步快 3 毫秒
gordic_aleksa · x · 2026-07-27
作者在解释一种长上下文结构为什么在规模变大、序列长度变长时会拖累性能。
核心方法
- 这项方案叫 Long-Short Sliding Window Attention。
- 思路借鉴了 Gemma 2 一类的 global-local / hybrid 架构,但实现上有两点不同:
- 不再混用 full attention 和 linear attention,而是改成 滑动窗口注意力。
- 有些层用更长的上下文窗口(long SWA),另一些层用较短窗口(short SWA)。
训练策略
- long SWA 的上下文长度以 两倍速度 做 warmup。
- 这样每步节省了大约 3 ms。
- 为了抵消验证损失略微变差,额外加了 15 个训练步,最终总体仍节省约 2–3 秒。
结论
- 这种设计能提速,但作者认为它在更长上下文下未必能线性扩展。
- 配图展示了层级结构和上下文 warmup 过程中 attention entropy 的变化。
「Infra」频道最新
- Wistron 在德州投产 7 亿美元工厂,量产 Nvidia GB300 与 Vera Rubin — Beth_Kindig · 2026-07-27
- BeeLlama.cpp 新增 KV cache 精度尾段和量化档位 — Anbeeld · 2026-07-27
- 本地跑 1 亿 token 的 GLM 5.2 只花 1 美元 — _akhaliq · 2026-07-27
- Cloudflare 的 AI training 拦截可能连 Googlebot 也挡住 — daluoseo · 2026-07-27
- 一个自托管代理把 424 个模型接到同一接口 — ranadheer535 · 2026-07-27
- LTT Labs 把两颗 AMD Ryzen AI Halo 集群起来仍没见明确优势 — LabsLucas · 2026-07-27