88 个用例 19 轮全跑实测:放弃 100% 作为 Agent 评测通过标准

oliver-zehentleitner · reddit · 2026-09-18

作者维护一套 88 个用例的编码 Agent 评测套件(Keep the Why),每个用例跑真实 agent 会话并由 LLM judge 评分,目标是连续三轮 88/88,但 19 轮实测证明这不现实:

作者据此改版发布标准:每个用例 3 跑至少 2 过、单轮失败不超过 1 个。这样失败有了含义——孤立失败是采样噪声,同一用例两次失败指向措辞问题,单轮多个失败指向回归。0.17.0 版本按此跑出 87/88、88/88、87/88,86 个用例三轮全过。

另一个产出:把 6 条控制确认行为的散文规则换成 6x3 决策表,文本缩短 21%,两轮完整评测零决策翻转。核心结论:当被测系统与评估器都是概率采样时,要求反复满分可能是个糟糕的验收标准。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →