SALT:基于 CELF 的 KV Cache 句子级压缩检索

No_Sky9786 · reddit · 2026-08-19

作者提出了 SALT,一种利用 CELF 算法从 KV Cache 中仅检索关键句子的结构。该方法在将长文档发送给语言模型之前将其压缩至固定大小,保留了信息量最高的句子。它适用于任何模型,能生成更短的纯文本提示,从而降低长输入的计算、内存和时间成本。目前项目在 GitHub 开源,作者正在寻求帮助,以找到比硬性 20/25% 比例更好的动态预算调整方案,以解决大规模预显存占用问题。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →