模型自己写的测试 77% 概率误杀正确代码,实测揭示 agent 管线隐坑
deadatreides1 · reddit · 2026-10-05
作者按标准流程搭了一条「写契约→写测试→写代码→跑测试→修复」的编码 agent 管线,然后做了一个少有人做的检查:把所有模型生成的测试喂给一个已知正确的参考实现,结果 168 个测试套件中 129 个(77%)拒绝了正确答案。
关键发现:
- 测试并非偷懒:平均变异分数 0.965,能抓住几乎所有机械性破坏;但变异分数满分的套件里仍有 81% 误杀正确实现——测试「彻底且自信地在验证错误的规格」。
- 典型案例:数元音任务中,代码忘了转小写,而测试的混合用例期望值也错成 5(正确是 10),测试和 bug 共享同一个误解,直接 PASS,修复环节根本没触发。
- 修复环节:67 次修复请求里 50 次是在修本来就正确的代码;真正的 17 个 bug 只修好了 1 个。
- 模型越大误杀越少但仍严重:llama-3.2-1b 误杀率 0.92-1.0,qwen2.5-coder-1.5b 约 0.75,qwen3-1.7b 约 0.47-0.65。
- 整条管线在相近 token 预算下还不如「裸采样 4-8 次」的基线。
局限:用的是 360M-1.7B 的小本地模型、6 个任务,大模型表现会好多少未知。作者现在的做法是:最终裁决的测试必须来自规格或人写的示例,模型可以提案测试,但不能当裁判。
「编程与Agent」频道最新
- OpenAI Agents API 十步教程:GPT-6.1 Sol 一折价格逼近 GPT-6 Astra — Roger_M_Taylor · 2026-10-05
- 被马斯克转发的访谈:工程师把自己从 agent 链路中「开除」 — Roger_M_Taylor · 2026-10-05
- 开源复古主机 DIGI-FUZE:AI 融合两张卡带 5 分钟生成新游戏 — Flomerboy · 2026-10-05
- 一条 defaults 命令解锁 macOS Computer Use 禁止目标限制 — GabGarrett · 2026-10-05
- 用 yt-dlp+Whisper+SQLite 搭个人知识库,Reddit 讨论多源信息 AI 摘要方案 — QuestionAsker2030 · 2026-10-05
- SpaceX 工程师自述:AI 代理自动合 PR,每月上千条 — itsOmSarraf_ · 2026-10-05