只读分析 agent 用 Flash Lite:缓存命中率仅 2.2%,成本全公开
RedaHaloubi · reddit · 2026-09-17
开发者 RedaHaloubi 更新其只读 POS 分析 agent(route→fetch→narrate→ground,Node/TS + Vercel AI SDK)的进展:采纳社区建议后暂停了写操作/HITL,坚持「预览≠确认」、幂等 + 乐观锁、变更附近 fail closed,在读取链路收紧前不加 mutate 工具。
模型与成本:继续用 Gemini Flash Lite(便宜、只需选工具+读小 JSON+双语叙述,不需要推理型模型),开发环境用免费额度。典型请求(50 轮意图、单店、Redis miss):输入 4,840 tokens、Gemini 缓存输入 0、输出 123 tokens、LLM 往返 2 次、工具调用 1 次、耗时 2.3s。更宽的日志(n=229)显示隐式缓存整体命中率仅 2.2%,CORE-12 前缀 0/96、pinned 0/51——前缀理论上可缓存但实际没命中,所以暂不加第二次模型调用。
两个待解问题:① 日期处理——门户总会传 dateRange,当同义词表未命中时(如「hier」「本月 vs 上月」),该用 UI chips 暂停询问还是保持默认并在首句说明?② 双语路由——关键词 pin 是英文的,法语请求匹配不到工具;他倾向在同一套正则上加 EN+FR 同义词表,而非翻译路由(会弄坏 $/%)。
附完整成本表与代码结构,评论区欢迎讨论。
所属事件:只读POS分析智能体复盘:缓存命中率仅2.2%,写入功能暂缓(2 条相关)→
「编程与Agent」频道最新
- TypeSafe AI 演示逐行语义搜索:一次请求给 218 行打相关性分 — hackgoofer · 2026-09-17
- 「Vibe automating」:把行政杂活全部交给 AI 自动化正成为新玩法 — aronkor · 2026-09-17
- Reddit 热议:为什么 AI 编码总是大量使用废弃函数 — sharificles · 2026-09-17
- Victor Taelin 宣布 Bend2 明日发布:面向后 AGI 经济的语言设计 — Birchlabs · 2026-09-17
- 用户实测 Devin 上 Fable 5.1+SWE-2 融合模式:连续工作3小时仅耗1%额度 — CtrlAltDwayne · 2026-09-17
- 实战:让 vLLM Prefix Cache 在 Agent 多轮间保持命中 — bolts98 · 2026-09-17