实证:禁掉 AI 写单元测试,agent 成功率反升且省时省钱

GabGarrett · x · 2026-10-09

开发者 @kunchenguid 在 deepswe 评测集上做了对照实验:禁止 Sonnet 写任何测试后,agent 任务成功率反而略高(非统计显著),耗时和 token 开销显著下降(统计显著)。基线组写出的测试中 65% 为单元测试、35% 为集成测试,两类都没有带来任何提升。作者还抽样 44 个任务禁用执行既有测试做了进一步验证。@shawmakesmagic 附和称自己几个月前就改为只用 e2e 测试,迭代速度和质量都提升了。对 agent 工程的直接启示:让 agent 别自己写测试,或只保留端到端测试。

所属事件:实测显示禁用 AI 写单元测试反而省时省钱(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →