一个"简单"获客 Agent 为什么要写这么多代码?隐私合规反复失控的教训
ravann4 · reddit · 2026-10-03
开发者复盘为房产客户搭建获客聊天 Agent 的真实工程量:原以为一个 prompt 加两个工具一周搞定,结果需求不断膨胀(线索分级变更、房源池扩到 8 万条),eval 维护耗掉大量时间。
最终架构(三层)
- Tier 1 纯代码:按钮、是/否、裸邮箱/手机号,不过模型
- Tier 2 小分类器(300ms):辱骂、同意、反机器人、隐私问题,简单场景走脚本回复
- Tier 3 单次 LLM 调用 + 3 个工具,所有工具调用由代码门控,写入 CRM 的每个字段都对照买家原话校验
隐私反复翻车:模型谎称没有隐私政策链接(其实有)、擅自改写合规话术(现在硬编码)、「Did you send it?」被误分类、本地测试对话经共享 dev 库进了客户真实 CRM、改过的邮箱仍发旧地址。结论:模型一碰合规文本就漂移,每把规则搬进代码就冒出新边界情况。
作者留下三个开放问题:前置快分类器值不值得保留(33 次失败中它背锅 0 次)、GPT-6 Luna 的工具调用 A/B 数据(68/9/2 vs 62/13/4 且成本减半)是否最优、以及如何在需求每周变更下保证同意环节不被跳过。
「编程与Agent」频道最新
- 用缓存工具输出重放 agent 会话,无副作用复现 bug 与换模测试 — pauliusztin · 2026-10-03
- 别再手搓 eval 数据集:把失败会话按类型分组回归测试 — pauliusztin · 2026-10-03
- 开发者称模型已够强,连 GPUI 都不需要,直接用数学排像素 — zack_overflow · 2026-10-03
- Redis 之父 antirez 吐槽:AI 编码工具安全检查频繁误报干扰工作 — antirez · 2026-10-03
- 让 DeepSeek 通宵修 14 个 bug PR,仅 6 个通过强模型评审 — Aggressive-Narwhal-3 · 2026-10-03
- 学者自研 Deep Research MCP:给 Claude 接入五大深度研究引擎 — PMinervini · 2026-10-03