只读分析 agent 用 Flash Lite:缓存命中率仅 2.2%,成本全公开

RedaHaloubi · reddit · 2026-09-17

开发者 RedaHaloubi 更新其只读 POS 分析 agent(route→fetch→narrate→ground,Node/TS + Vercel AI SDK)的进展:采纳社区建议后暂停了写操作/HITL,坚持「预览≠确认」、幂等 + 乐观锁、变更附近 fail closed,在读取链路收紧前不加 mutate 工具。

模型与成本:继续用 Gemini Flash Lite(便宜、只需选工具+读小 JSON+双语叙述,不需要推理型模型),开发环境用免费额度。典型请求(50 轮意图、单店、Redis miss):输入 4,840 tokens、Gemini 缓存输入 0、输出 123 tokens、LLM 往返 2 次、工具调用 1 次、耗时 2.3s。更宽的日志(n=229)显示隐式缓存整体命中率仅 2.2%,CORE-12 前缀 0/96、pinned 0/51——前缀理论上可缓存但实际没命中,所以暂不加第二次模型调用。

两个待解问题:① 日期处理——门户总会传 dateRange,当同义词表未命中时(如「hier」「本月 vs 上月」),该用 UI chips 暂停询问还是保持默认并在首句说明?② 双语路由——关键词 pin 是英文的,法语请求匹配不到工具;他倾向在同一套正则上加 EN+FR 同义词表,而非翻译路由(会弄坏 $/%)。

附完整成本表与代码结构,评论区欢迎讨论。

所属事件:只读POS分析智能体复盘:缓存命中率仅2.2%,写入功能暂缓(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →