同一输入每次路径都不同:Agent 回归测试怎么做才靠谱?
No-Age-3362 · reddit · 2026-09-30
Reddit 上一场关于 agent 回归测试的讨论:单元测试假设同输入同输出,但 agent 打破了这一前提——同一个任务一次跑调 3 个工具、下一次跑调 5 个,都得到正确答案;更危险的是表面都正常、其中一次悄悄跳过了本该执行的检查。
作者指出两种常见做法各有盲区:
- 只比对最终输出:发现不了「跳过检查」这类静默错误
- 比对完整轨迹:会把合法的多路径解法误判为失败
帖子梳理了现有的部分性方案:只断言结果、断言少量必须/禁止的步骤(如必须先调 X、绝不调 Z)、同一用例跑多次算通过率、以及用 LLM judge 审查轨迹。作者向有生产经验的开发者追问:大家实际在用什么方案?每个用例要跑多少次才敢信一个通过率?
「编程与Agent」频道最新
- 开源小红书相关词爬虫 Skill:Codex 一小时抓万条长尾词并自动评分 — vista8 · 2026-09-30
- Constella 接入 Blender MCP:缺口不少但上限很高 — sidahuj · 2026-09-30
- 律所 AI 工作组实测多模型,Claude 全面胜出 — jkubicki · 2026-09-30
- 实测 Dot 智能体:比 Grok Bot 聪明,却常无视用户设定的 skills 约束 — jdjohnson · 2026-09-30
- OpenAI 推出网页测试云 API,独立测试或成创业公司的护城河 — hugs · 2026-09-30
- Claude+小模型混合架构,1000次决策成本从605美元降到0.17美元 — jamestagg · 2026-09-30