SALT:基于 CELF 的 KV Cache 句子级压缩检索
No_Sky9786 · reddit · 2026-08-19
作者提出了 SALT,一种利用 CELF 算法从 KV Cache 中仅检索关键句子的结构。该方法在将长文档发送给语言模型之前将其压缩至固定大小,保留了信息量最高的句子。它适用于任何模型,能生成更短的纯文本提示,从而降低长输入的计算、内存和时间成本。目前项目在 GitHub 开源,作者正在寻求帮助,以找到比硬性 20/25% 比例更好的动态预算调整方案,以解决大规模预显存占用问题。
「Infra」频道最新
- 开发者称 OpenAI 与 Anthropic 额度数日用尽 — antirez · 2026-08-19
- 机器人仿真被视为最清洁的创新激励系统 — const_reborn · 2026-08-19
- 网友询问各订阅服务的 Token 补贴现状,求可靠对比 — mitsuhiko · 2026-08-19
- Meta 发布 Muse Glimmer:30B 本地语音 agent 实现低延迟推理 — Once_ina_Lifetime · 2026-08-19
- Gortex 引擎:基于图索引降低 50% Token 消耗 — tom_doerr · 2026-08-19
- Nvidia GPU 利用率误导大?A100 实测指令发射率不足一半 — tokenbender · 2026-08-19