SALT 用 trie 压缩长上下文,降低 LLM 运行成本

No_Sky9786 · reddit · 2026-07-21

这是一个面向长上下文场景的 **LLM runner** 项目,主打用 trie 做记忆与压缩,减少推理时的算力和内存开销。 - **SALT** 会先把长文压缩成固定长度的提示词,只保留信息量最高的句子,再送给模型。 - 它可以配合任意模型使用,输出的是更短的纯文本 prompt,从而降低长输入带来的计算、内存和等待时间。 - **saltChat** 会把主题 trie 常驻在 DRAM 中,因此同一份文档只需索引一次,后续对话不必每轮重新读取。 - 这条帖子还在招募贡献者。

原文链接 →

「Infra」频道最新

更多「Infra」频道 AI 资讯 →