客服机器人每轮注入 25 万 token,开发者晒「不用 RAG」方案求反驳
louay_Sallakho · reddit · 2026-09-15
一位运营 WhatsApp 客服机器人(服务约 2.7 万客户)的开发者分享了其激进架构:每次对话都注入约 25.2 万 token 的完整 prompt,完全不用 RAG。
Prompt 四层结构
- 主 prompt:全部政策规则
- ERP 实时参数:约 320 个(余额、合同状态、日期等)在模型调用前直接填入,模型无需自行查询
- 条件政策块:约 130 组 if/then 分支,由 Python 在组装 prompt 时(而非让模型)判断条件,只注入命中的分支
- 护栏:独立 LLM 在客户看到回复前审查输出
为何拒绝 RAG:他们同时维护一个检索版(分类器挑选政策段落,每条约 5.5 万 token,便宜 4.6 倍),但认为「检索会静默失败」——分类器抓错段落时模型不会说不知道,而是自信地给出错误答案,等客户被误导后才发现。全文发送则没有可失败的检索环节。
作者提出的关键疑问:25 万 token 下注意力衰减有多严重(靠底部的规则是否真的被执行)、这种「prompt 组装期分支决策」是否有正式名称、以及大家如何做 prompt 的版本管理与回滚。用了 Notion + n8n 搭建。
「编程与Agent」频道最新
- 咨询顾问分享:按需使用的工程实践与专用 skill — _rchaves_ · 2026-09-15
- Kimi Code 更新:远程控制全量开放,Linux 剪贴板原生支持 — KimiDevs · 2026-09-15
- 开发者分享 Claude Code 持久记忆 skill 实战用法 — doodlestein · 2026-09-15
- Hermes Newswire 零 token 新闻滚动条被合入 Nous Research 官方插件目录 — Teknium · 2026-09-15
- 开源项目 vphone-cli 单日涨 633 星:让 AI 智能体操控真·虚拟 iPhone — JiliJeanlouis · 2026-09-15
- Codex 疑似悄悄下架 deep-research 技能,子代理运行时缩水 20% — Hot_Independence5160 · 2026-09-15