社区激辩 agent 编码评测能否测出回归
Pawel Huryn 连续发文质疑以 DeepSWE 为代表的 agent 编码评测存在结构性缺陷:agent 编写的测试只有一次运行机会,评分方不执行,后续改动也无环节复跑,且单一容器任务难以反映真实世界的回归风险,因此评测无法证明 agent 未来不引入回归。DeepSWE 评测作者 kunchenguid 逐条回应,指出「测试只为防回归」的前提不成立,测试在人类 TDD 首次开发等场景同样关键,并称禁用旧测试套件后 agent 并未引入更多回归。
2026-10-09 ~ 2026-10-09 · 3 条相关
- DeepSWE 评测作者回应质疑:禁用旧测试套件后 agent 未引入更多回归 — kunchenguid · 2026-10-09
- Pawel Huryn 质疑 agent 编码评测:一次成型不等于未来不出回归 — PawelHuryn · 2026-10-09
- PawelHuryn 指出 DeepSWE 局限:单一容器任务测不出真实世界回归 — PawelHuryn · 2026-10-09