随机性 agent 如何做 CI?开发者开源 AgentSeism 判断回归是否真实
puppy_lover_2021 · reddit · 2026-09-27
一位为 agent 搭建 CI 的开发者分享踩坑历程:同一份代码不改,agent 成功率也能在 92% 与 88% 之间波动,直接卡 PR 会误报;反过来,他故意劣化 agent 使成功率从 92% 跌到 52%,统计规则却放行了,因为损失集中在个别任务上而非整体分数。
由此他主张把 agent CI 当实验而非确定性测试,区分两个问题:整体可靠性是否变差,以及某个已可靠的能力是否坍塌。方案包括重复运行、实用效应阈值、不确定性、跨能力的多重性校正,以及显式的"证据不足"状态。
已开源为 AgentSeism,并附博客说明设计推理与失败案例,向社区征集:你们如何判断 agent 分数下降大到足以阻断合并?
「编程与Agent」频道最新
- MongoDB 发布 Agent Skills,让 AI 编码助手写出更规范的数据库代码 — TheTuringPost · 2026-09-27
- GitHub CEO:AI Agent 正在对代码审查发动 DoS 攻击 — jonmarkgo · 2026-09-27
- 开发者用 Codex Computer Use 盯 Claude Code 干活进度 — vista8 · 2026-09-27
- Claude 一句话生成精细 3D 海港场景,细节惊艳社区 — EricBuess · 2026-09-27
- 用 Mercator 搭航班取消监控,每 30 分钟仅花几美分 — jeff_weinstein · 2026-09-27
- Opus 5.5 写代码,GitHub Actions 渲染成 6 分 54 秒短片 — EricBuess · 2026-09-27