实测显示禁用 AI 写单元测试反而省时省钱
开发者 kunchenguid 在 deepswe 评测集上做了对照实验,结果相当反直觉:禁止 Claude Sonnet 编写任何单元测试后,agent 的任务成功率不仅没有下降,反而略有提升(但差异不具统计显著性),同时耗时与 token 消耗显著减少。这一发现挑战了让 AI agent 在编码过程中自行编写测试以保障质量的传统做法,引发社区对测试在 agent 工作流中实际价值的讨论。
2026-10-08 ~ 2026-10-09 · 2 条相关
- 实测显示 AI 写的单元测试无助于提升 agent 成功率 — GabGarrett · 2026-10-08
另有 1 条近重复转述:GabGarrett