随机性 agent 如何做 CI?开发者开源 AgentSeism 判断回归是否真实

puppy_lover_2021 · reddit · 2026-09-27

一位为 agent 搭建 CI 的开发者分享踩坑历程:同一份代码不改,agent 成功率也能在 92% 与 88% 之间波动,直接卡 PR 会误报;反过来,他故意劣化 agent 使成功率从 92% 跌到 52%,统计规则却放行了,因为损失集中在个别任务上而非整体分数。

由此他主张把 agent CI 当实验而非确定性测试,区分两个问题:整体可靠性是否变差,以及某个已可靠的能力是否坍塌。方案包括重复运行、实用效应阈值、不确定性、跨能力的多重性校正,以及显式的"证据不足"状态。

已开源为 AgentSeism,并附博客说明设计推理与失败案例,向社区征集:你们如何判断 agent 分数下降大到足以阻断合并?

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →