客服机器人每轮注入 25 万 token,开发者晒「不用 RAG」方案求反驳

louay_Sallakho · reddit · 2026-09-15

一位运营 WhatsApp 客服机器人(服务约 2.7 万客户)的开发者分享了其激进架构:每次对话都注入约 25.2 万 token 的完整 prompt,完全不用 RAG。

Prompt 四层结构

为何拒绝 RAG:他们同时维护一个检索版(分类器挑选政策段落,每条约 5.5 万 token,便宜 4.6 倍),但认为「检索会静默失败」——分类器抓错段落时模型不会说不知道,而是自信地给出错误答案,等客户被误导后才发现。全文发送则没有可失败的检索环节。

作者提出的关键疑问:25 万 token 下注意力衰减有多严重(靠底部的规则是否真的被执行)、这种「prompt 组装期分支决策」是否有正式名称、以及大家如何做 prompt 的版本管理与回滚。用了 Notion + n8n 搭建。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →