实测显示 AI 写的单元测试无助于提升 agent 成功率

GabGarrett · x · 2026-10-08

kunchenguid 在 deepswe 评测集上的实验给出了反直觉结论:禁止 Sonnet 写任何测试反而带来略高的成功率(不显著),且耗时和 token 消耗显著减少。

关键发现:

作者结论:AI 写的单元测试与集成测试经实证证明无帮助,应让 agent 停止自己写测试。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →