3500 token 请求几乎全命中缓存:Engram agent 记忆放置实战指南
dl_weekly · x · 2026-09-30
Weaviate 开发者布道师撰文讲解如何将 agent 记忆(Engram 服务)接入提示词并保持 KV 缓存命中:一个 3500 token 的最终请求中仅约 100 token 未从缓存读取。
文章指出接入 Engram 只是「能跑」,真正需要开发者自己拍板的有四个决策:
- 记什么:topic 描述决定哪些内容被提取为记忆
- 记多少、记谁的:用有界 topic 和 scope 控制记忆数量与归属
- 取回什么:检索模式决定返回内容
- 放在哪:记忆在 prompt 中的位置——这是缓存能否存活的关键
Engram 通过异步管道处理原始对话数据(提取→与已有记忆融合转换→提交),memories.add 返回的是 run 而非立即可搜索的记忆,文中建议不要阻塞等待 run 完成。
「编程与Agent」频道最新
- 微软研究:六个主流 LLM 编程时也存在达克效应式自信偏差 — burkov · 2026-09-30
- 把整个应用接进 ChatGPT:插件扩展实现聊天控制社媒排期 — haltakov · 2026-09-30
- Seroter 日报:AI 生成编码越快,工程越难;供应链安全信心缺失 — rseroter · 2026-09-30
- 微软推出 Azure Canvases:在 GitHub Copilot 内直接管理 Azure 资源 — DanWahlin · 2026-09-30
- Anthropic 大量内部软件已由 Claude 构建,Krieger 称是年度最大转变 — victor_explore · 2026-09-30
- GPT-6.1 Sol 实测:105 个植入 bug 修 44 个,成本仅为上代 1/15 — PawelHuryn · 2026-09-30