开发者开源 LLM 缓存代理:用精确匹配解决 Agent 重复 Token 消耗
iwasinnam2 · reddit · 2026-08-01
开发者在 Reddit 分享了一个开源的 LLM 调用缓存代理(MIT 协议),旨在解决 AI 智能体(Agent)在循环和重试中频繁发起相同请求所导致的算力与资金浪费。
核心设计与痛点解决:
- 精确匹配优于语义缓存: 作者刻意放弃语义缓存,认为“几乎相同的提示词”并不等同,语义近似容易导致回答偏差,从而让省钱功能变成退款纠纷。
- 底层运行机制: 系统在模型提供商前架设管道,对请求进行规范化并计算哈希值。完全相同的请求会直接从 Redis 重放(包括流式响应的 SSE 重组)。
- 安全与隐私: 所有抓取的网络上下文在送入模型前,都会先经过 robots.txt 检查、PII(个人身份信息)脱敏以及 SSRF 防护过滤。
「编程与Agent」频道最新
- 编码智能体成本大比拼:Claude Code 花费约为开源方案 3.7 倍 — Teknium · 2026-08-01
- Grok Build 更新:支持永久删除会话与诊断优化 — XFreeze · 2026-08-01
- 开发者用 Codex 实现 GitHub 贡献破 3000,月耗百亿 token — DeryaTR_ · 2026-08-01
- DeepSeek-V4-Flash 登顶前端代码性价比,总榜排第七 — arena · 2026-08-01
- claude-pulse: 实时监控 Claude Code 额度的状态栏工具 — tom_doerr · 2026-08-01
- 滑铁卢大学 R2L 实验室将招募 PhD,深耕智能体与推理研究 — hllo_wrld · 2026-08-01