推理时给预训练 LLM 加滑窗注意力,64K 上下文 KV 缓存仅 3.5MB
ahsaor8 · reddit · 2026-09-06
作者实现了面向 HuggingFace 因果 LLM 的滑窗注意力(SWA)推理层,无需修改或重训模型。
- 核心思路:KV 缓存只保留 attention sinks + 固定大小滑窗,用环形缓冲区存储,配合流式 prefill 和分块注意力掩码。
- 实测(Qwen2.5-7B):16K 上下文下 KV 内存从约 923MB 降到约 3.5MB,32K 从约 1.84GB 降到 3.5MB,64K 下全注意力 OOM 而 SWA 依然有界;16K 时 TPOT 从约 38.4ms 降至约 30.5ms。
- 代价:窗口外的远距离信息检索会退化,作者正在探究这多少是 SWA 固有、多少是实现或模型特性所致。
- 代码开源,作者征求反馈:下一个验证哪些架构、该测哪些失败案例、如何接入现有 HF 推理流程。
所属事件:开源项目 swallm 为 HF LLM 推理实现滑窗注意力(2 条相关)→
「Infra」频道最新
- Polygres 把 Postgres 变成 AI agent 的混合检索上下文层 — Scobleizer · 2026-09-06
- TCS 联手 TPG 拟投 74 亿美元,在印度建 1GW AI 园区 — emmanuelvivier · 2026-09-06
- 实测 vLLM 广告 KV cache 注水,压力测试工具揭示真实保留率 — t4a8945 · 2026-09-06
- 实测推翻论文数据:DiffusionGemma 峰值吞吐实为 3k tok/s,约为论文 3 倍 — bodonoghue85 · 2026-09-06
- 作者为 HF LLM 推理实现滑窗注意力,实测 32K 上下文 KV 缓存 3.5MB — ahsaor8 · 2026-09-06
- 做一个比价面板,帮你找到跑 MiniMax H3 最便宜的 GPU — CategoryFew5869 · 2026-09-06