WhatsApp 客服机器人每条消息塞 25.2 万 token,弃用检索保准确
louay_Sallakho · reddit · 2026-09-16
一位支撑 2.7 万客户的 WhatsApp 客服 bot 工程师分享了争议架构:每次调用都把全部政策文本(约 25.2 万 token)塞进 prompt,没有任何检索步骤。架构分四层:全量政策主 prompt、约 320 个运行时预填的系统实时值(余额、合同状态等)、约 130 个在构建 prompt 时就完成条件判断的 if/then 政策块、以及独立的 LLM 守护栏检查回复与工具调用。
他们其实也做了检索版:小型分类器只挑相关段落,平均每条消息约 5.5 万 token,便宜 4.6 倍。但最终保留了昂贵的全量版,理由是检索失败是静默的——取错段落时机器人依然答得斩钉截铁,错误要等几周后从愤怒客户那里才知道;全量注入则消灭了查取出错这一环节。
作者留下的疑问:250k 深度处的指令遵循到底衰减多严重?80% 深度的规则还会被遵守吗?这么大的 prompt 如何做版本管理与回归测试(他认为这比 token 成本更难)?欢迎有同规模实战经验者指点。
「编程与Agent」频道最新
- 开发者经验:给 AI Agent 预建用户数据导出包的六步清单 — blaizedsouza · 2026-09-16
- 开源工具 Tulip 用 LLM 把 GitHub PR 改写成图文讲解页 — blaizedsouza · 2026-09-16
- 曝 AI Agent 初创 Instinct 谈融资,估值达 100 亿美元 — pstAsiatech · 2026-09-16
- 腾讯开源 BrowserSkill:让 AI Agent 复用你已登录的真实浏览器 — AIFlow_ML · 2026-09-16
- Apodex 同步开源 FrontierAgent 框架,35B 权重可本地跑 — testingcatalog · 2026-09-16
- Apodex 发布 1.1:从研究问答转向真实任务执行 — testingcatalog · 2026-09-16