推理时给预训练 LLM 加滑窗注意力,64K 上下文 KV 缓存仅 3.5MB

ahsaor8 · reddit · 2026-09-06

作者实现了面向 HuggingFace 因果 LLM 的滑窗注意力(SWA)推理层,无需修改或重训模型。

所属事件:开源项目 swallm 为 HF LLM 推理实现滑窗注意力(2 条相关)→

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →