WhatsApp 客服机器人每条消息塞 25.2 万 token,弃用检索保准确

louay_Sallakho · reddit · 2026-09-16

一位支撑 2.7 万客户的 WhatsApp 客服 bot 工程师分享了争议架构:每次调用都把全部政策文本(约 25.2 万 token)塞进 prompt,没有任何检索步骤。架构分四层:全量政策主 prompt、约 320 个运行时预填的系统实时值(余额、合同状态等)、约 130 个在构建 prompt 时就完成条件判断的 if/then 政策块、以及独立的 LLM 守护栏检查回复与工具调用。

他们其实也做了检索版:小型分类器只挑相关段落,平均每条消息约 5.5 万 token,便宜 4.6 倍。但最终保留了昂贵的全量版,理由是检索失败是静默的——取错段落时机器人依然答得斩钉截铁,错误要等几周后从愤怒客户那里才知道;全量注入则消灭了查取出错这一环节。

作者留下的疑问:250k 深度处的指令遵循到底衰减多严重?80% 深度的规则还会被遵守吗?这么大的 prompt 如何做版本管理与回归测试(他认为这比 token 成本更难)?欢迎有同规模实战经验者指点。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →