开源项目 swallm 为 HF LLM 推理实现滑窗注意力

有开发者为 HuggingFace 因果 LLM 实现了推理时的滑窗注意力层,无需修改或重训模型即可启用。其核心思路是 KV 缓存只保留 attention sinks 等关键内容,实测在 32K 至 64K 长上下文下 KV 缓存仅需约 3.5MB。该实验已被封装为可复用的开源项目 swallm,方便其他研究者测试长上下文推理中的 KV 缓存优化效果。

2026-09-06 ~ 2026-09-06 · 2 条相关