开源项目 swallm 为 HF LLM 推理实现滑窗注意力
有开发者为 HuggingFace 因果 LLM 实现了推理时的滑窗注意力层,无需修改或重训模型即可启用。其核心思路是 KV 缓存只保留 attention sinks 等关键内容,实测在 32K 至 64K 长上下文下 KV 缓存仅需约 3.5MB。该实验已被封装为可复用的开源项目 swallm,方便其他研究者测试长上下文推理中的 KV 缓存优化效果。
2026-09-06 ~ 2026-09-06 · 2 条相关
- 作者为 HF LLM 推理实现滑窗注意力,实测 32K 上下文 KV 缓存 3.5MB — ahsaor8 · 2026-09-06
- 推理时给预训练 LLM 加滑窗注意力,64K 上下文 KV 缓存仅 3.5MB — ahsaor8 · 2026-09-06