SALT 用 trie 压缩长上下文,降低 LLM 运行成本
No_Sky9786 · reddit · 2026-07-21
这是一个面向长上下文场景的 **LLM runner** 项目,主打用 trie 做记忆与压缩,减少推理时的算力和内存开销。 - **SALT** 会先把长文压缩成固定长度的提示词,只保留信息量最高的句子,再送给模型。 - 它可以配合任意模型使用,输出的是更短的纯文本 prompt,从而降低长输入带来的计算、内存和等待时间。 - **saltChat** 会把主题 trie 常驻在 DRAM 中,因此同一份文档只需索引一次,后续对话不必每轮重新读取。 - 这条帖子还在招募贡献者。
「Infra」频道最新
- AI 性能瓶颈正转向材料科学,而不只是算力 — nordicinst · 2026-07-21
- GLM-5.2 推理争论:750B 参数怎么跑过 1 token/s — francoisfleuret · 2026-07-21
- 为什么持续写入会让向量数据库拖慢 AI agent — PrajwalTomar_ · 2026-07-21
- Fink 说中国领跑 AI 能源赛,称在建 100GW 核电 — rohanpaul_ai · 2026-07-21
- 本地 AI 约 6 到 7 年回本,长期可省 30% 到 40% — DavidLinthicum · 2026-07-21
- 台积电被曝拟在 2027 年上调芯片代工价格最高 10% — kimmonismus · 2026-07-21