实证:禁掉 AI 写单元测试,agent 成功率反升且省时省钱
GabGarrett · x · 2026-10-09
开发者 @kunchenguid 在 deepswe 评测集上做了对照实验:禁止 Sonnet 写任何测试后,agent 任务成功率反而略高(非统计显著),耗时和 token 开销显著下降(统计显著)。基线组写出的测试中 65% 为单元测试、35% 为集成测试,两类都没有带来任何提升。作者还抽样 44 个任务禁用执行既有测试做了进一步验证。@shawmakesmagic 附和称自己几个月前就改为只用 e2e 测试,迭代速度和质量都提升了。对 agent 工程的直接启示:让 agent 别自己写测试,或只保留端到端测试。
所属事件:实测显示禁用 AI 写单元测试反而省时省钱(2 条相关)→
「编程与Agent」频道最新
- hashcards v0.5.0 发布:新增 Web 界面浏览卡片集 — zetalyrae · 2026-10-09
- 开发者一周 vibe coding 复刻 Counter-Strike,浏览器即开即玩 — TAbrodi · 2026-10-09
- Claude Code 空闲时自动压缩上下文,赶在提示词缓存过期前省额度 — JeremyNguyenPhD · 2026-10-09
- Hermes Desktop 主动智能 UI 亮相:不用开口就嵌入可视化卡片 — Teknium · 2026-10-09
- 用 Claude 接 Wan 剪 MV:Reddit 用户展示全 AI 音乐视频工作流 — ChiefMustacheOfficer · 2026-10-09
- Nous Hermes 上线 TinyFish 插件:免费联网搜索与按计费的云端浏览器 — Teknium · 2026-10-09