作者为 HF LLM 推理实现滑窗注意力,实测 32K 上下文 KV 缓存 3.5MB
ahsaor8 · reddit · 2026-09-06
作者将滑窗注意力(SWA)实验做成了可复用的开源项目 swallm,供 HF 因果 LLM 测试长上下文推理的 KV 缓存优化。
- 实现要点:少量 attention sink token + 有界近窗 token、环形缓冲 KV 缓存、流式/分块 prefill、常规自回归解码;几行代码即可从预训练模型加载 SWA 模式。
- Qwen2.5-7B 实测(L40S):32K 上下文 KV 缓存约 1.84GB(全注意力)对约 3.5MB(SWA-64);64K 下全注意力 OOM 而 SWA 依然有界;解码延迟随上下文增长基本恒定。
- 定位:不宣称 SWA 全面更优,重点在上下文保留、KV 内存、TTFT 与解码速度之间的工程权衡;欢迎大家在 Llama、Mistral、Gemma 等架构上测试并反馈兼容性问题。
所属事件:开源项目 swallm 为 HF LLM 推理实现滑窗注意力(2 条相关)→
「Infra」频道最新
- Polygres 把 Postgres 变成 AI agent 的混合检索上下文层 — Scobleizer · 2026-09-06
- TCS 联手 TPG 拟投 74 亿美元,在印度建 1GW AI 园区 — emmanuelvivier · 2026-09-06
- 实测 vLLM 广告 KV cache 注水,压力测试工具揭示真实保留率 — t4a8945 · 2026-09-06
- 实测推翻论文数据:DiffusionGemma 峰值吞吐实为 3k tok/s,约为论文 3 倍 — bodonoghue85 · 2026-09-06
- 做一个比价面板,帮你找到跑 MiniMax H3 最便宜的 GPU — CategoryFew5869 · 2026-09-06
- 16GB 显存跑 Qwen3.8 本地模型做村庄模拟游戏,75 t/s 出字 — Fancy-Snow7 · 2026-09-06