88 个用例 19 轮全跑实测:放弃 100% 作为 Agent 评测通过标准
oliver-zehentleitner · reddit · 2026-09-18
作者维护一套 88 个用例的编码 Agent 评测套件(Keep the Why),每个用例跑真实 agent 会话并由 LLM judge 评分,目标是连续三轮 88/88,但 19 轮实测证明这不现实:
- 总通过率 98.6%,平均每轮约 1 个用例失败,且每次失败的是不同用例,很多此前已连续通过 20-30 次
- agent 和 judge 都无法固定随机种子,"连续三轮满分"衡量的是运气而非质量
- 追逐孤立失败反而破坏稳定性:为修复单次失败加的句子,有 3 处导致邻近从未失败的用例翻转
作者据此改版发布标准:每个用例 3 跑至少 2 过、单轮失败不超过 1 个。这样失败有了含义——孤立失败是采样噪声,同一用例两次失败指向措辞问题,单轮多个失败指向回归。0.17.0 版本按此跑出 87/88、88/88、87/88,86 个用例三轮全过。
另一个产出:把 6 条控制确认行为的散文规则换成 6x3 决策表,文本缩短 21%,两轮完整评测零决策翻转。核心结论:当被测系统与评估器都是概率采样时,要求反复满分可能是个糟糕的验收标准。
「编程与Agent」频道最新
- 在去审查版 Qwen 27B 上训 LoRA 记住内部代码库,成本约 7.5 小时 — Similar_Job_6080 · 2026-09-18
- 网友建开源仓库汇集 JEV 最佳用例,欢迎 PR 补充 — matchaman11 · 2026-09-18
- 编码 agent 会话丢失痛失 3 天工作,开发者呼吁 agent 工作流也能「fork」 — LeviYagami · 2026-09-18
- 用户抱怨 Codex 里 Astra 20 倍订阅也几乎不可用,呼吁学 Anthropic 给订阅配额 — CtrlAltDwayne · 2026-09-18
- 用 Jev+AXe 控制 iOS 模拟器:速度飞快、成本远低于 LLM — stefanjblos · 2026-09-18
- 用 Jev 审 PR:单次 $0.00007,比 Opus 便宜约 200 倍 — stefanjblos · 2026-09-18