实测 agent 回归检测:embedding 只抓到 7/19 真实变更
redhatpanda07 · reddit · 2026-09-23
作者维护一套已批准的问答对用于 agent 回归验证:改 prompt 后重放,判断答案是「意思没变的改写」还是「真的变了」。他构造了 109 对已知真相的测试集(3 种表面改动、4 条规则改动,19 对真实变更)实测五种检测器。
结果对比:
- 精确匹配:19/19 检出,但 90 对改写中 84 对误报
- embedding(<0.75):只检出 7/19
- 标记→embedding→LLM judge 的三层生产栈:19/19,误报 33
- gpt-4o-mini judge:18/19,误报 19,平均 0.0071 美元
- Jev(单 Choice 输出):19/19,误报 12,0.43 秒、0.0028 美元
核心教训:误报才是关键指标——每个误报都浪费一次人工复读;召回不难。还发现四条「破坏性」改动中有一条实际什么都没改变(agent 本来就推荐 Team plan),而栈仍然误报 8/16。作者提醒这是 fixture 而非生产流量,单次运行数字有波动,并建议尝试对结构化抽取做 diff、或按 claim 而非整答案判断。
「编程与Agent」频道最新
- 用小模型打分管理 Agent 上下文,比一次性摘要更省更快 — marlene_zw · 2026-09-23
- dair-ai 教程:用 Pi 和 Jev 搭自定义 Agent Harness — dair_ai · 2026-09-23
- PSAISuite:用 PowerShell 统一接入 15+ 家大模型厂商 — dfinke · 2026-09-23
- AI 改 UI 越改越烂?视觉反馈循环是解法 — nikola_mr64990 · 2026-09-23
- 长会话突然变笨?不是模型变差,是上下文里堆满了"垃圾" — ClickOk5811 · 2026-09-23
- API 提取效果比 App 差?问题出在文件预处理而非模型本身 — TangeloOk9486 · 2026-09-23