实测显示 AI 写的单元测试无助于提升 agent 成功率
GabGarrett · x · 2026-10-08
kunchenguid 在 deepswe 评测集上的实验给出了反直觉结论:禁止 Sonnet 写任何测试反而带来略高的成功率(不显著),且耗时和 token 消耗显著减少。
关键发现:
- 允许写测试的基线组中,65% 是单元测试、35% 是集成测试,但两类测试相比不写测试都没有带来成功率提升
- 在随机抽取的 44 个任务子集上完全禁用执行已有测试,成功率也毫无变化
- 作者抽查了基线组写的测试,直觉判断多数测试只是对实现本身的重复
作者结论:AI 写的单元测试与集成测试经实证证明无帮助,应让 agent 停止自己写测试。
「编程与Agent」频道最新
- Ramp 藏在 AI 可读文件里的隐藏优惠被用户挖出 — gaganghotra_ · 2026-10-08
- 把旧 Notion 课程喂给 Codex,秒变可交互课程 — RichardsonDx · 2026-10-08
- Gary Bernhardt:「AI 工厂」正在重演十年前微服务过度工程的老路 — sergeykarayev · 2026-10-08
- 研究者提出:长程任务进展有赖分层 RL 混合快慢折扣率 — jessi_cata · 2026-10-08
- 本地 MCP 记忆服务 Graph-MIND 发布:LongMemEval 达 88.8% 且写入零 LLM 调用 — BrilliantGrocery8233 · 2026-10-08
- dotey 实操:让 Fable 当 Tech Lead 派活验收,Opus 执行 — dotey · 2026-10-08