cache-proxy 代理发布:语义缓存降 LLM 成本,x402 按量付费
modelcontextprotocol · reddit · 2026-09-29
一款名为 cache-proxy 的 LLM 缓存代理上线,提供精确缓存与语义缓存两种模式,可重复命中相同或相似请求以降低推理成本。
计费采用 x402 协议、以 USDC 在 Base 链上按用量结算,并提供免费的健康检查接口。对高频重复查询的 LLM 应用是值得关注的省钱方案。
「Infra」频道最新
- 开源项目 Celesto:给 AI Agent 一台 500 毫秒启动的专属电脑 — aniketmaurya · 2026-09-29
- 算账:Meta Muse 即便激进优化,每用户年成本也达 50 美元 — bookwormengr · 2026-09-29
- 手机+三台 Mac+两台 PC 拼出 60GB 内存,跑通 gpt-oss-120b — ANR2ME · 2026-09-29
- BioNeMo 团队优化稀疏模型训练:Mixtral 吞吐提升 2.21 倍 — AllThingsApx · 2026-09-29
- DeepSeek 弹性计算团队大量招人,发布大规模 Agent 训练沙盒基建分享 — teortaxesTex · 2026-09-29
- 开发者吐槽第三方推理服务乱象:Gemini 一年涨 10 倍 — julianharris · 2026-09-29