每个字都出自政策文档,客服机器人却答错了:你的eval能抓住吗
YakDue6710 · reddit · 2026-10-07
一位做 agent eval 的开发者分享了一个极简但致命的反例,用来击穿「答案是否出现在来源里」式的检查:
政策文档
- 未拆封商品:30 天内退货,全额退款至原支付方式
- 已拆封商品:14 天内退货,仅得商店积分
- 退款 5-7 个工作日到账
用户:我 10 天前买的耳机已拆封,能退款吗?
机器人:可以。你在 30 天退货期内,可全额退款至原支付方式,退款 5-7 个工作日到账。
妙处在于:机器人回答里的每个数字和短语都真实存在于政策文档,没有任何编造——但它把「未拆封」的规则套在了已拆封商品上,向用户承诺了本不该有的现金退款。任何「文本是否出现在来源中」的校验都会放行,最后一句单独看甚至是真的。
作者据此提出两个问题:你的 eval/guardrail 能否标记这类错误?最后一句该如何判「有依据/无依据」?并表示还有近似数字、遗漏例外条款、两份文档互相矛盾等更多案例可以分享。
「编程与Agent」频道最新
- 实测:GPT-6-luna 用 API 每 effort 档能多给推理 token — LysandreJik · 2026-10-07
- Copilot 被「自解密」恶意指令攻破,半数测试泄露本地机密 — Haunting_Ganache_850 · 2026-10-07
- 企业 AI 落地反着来:先做分析预测,聊天机器人是终点 — shashib · 2026-10-07
- Gradio 推出 ML Intern:一条提示词即可自动为你构建 Gradio 应用 — Gradio · 2026-10-07
- Bug Hunt 实测:GPT-6.1 Sol 能翻盘修复, Muse 系仍是最便宜主力 — PawelHuryn · 2026-10-07
- Opus 5.5 加 MCP 全自动剪辑:一条 Claude skill 包揽 After Effects 工序 — smtabatabaie · 2026-10-07