社区激辩 agent 编码评测能否测出回归

Pawel Huryn 连续发文质疑以 DeepSWE 为代表的 agent 编码评测存在结构性缺陷:agent 编写的测试只有一次运行机会,评分方不执行,后续改动也无环节复跑,且单一容器任务难以反映真实世界的回归风险,因此评测无法证明 agent 未来不引入回归。DeepSWE 评测作者 kunchenguid 逐条回应,指出「测试只为防回归」的前提不成立,测试在人类 TDD 首次开发等场景同样关键,并称禁用旧测试套件后 agent 并未引入更多回归。

2026-10-09 ~ 2026-10-09 · 3 条相关