模型自己写的测试 77% 概率误杀正确代码,实测揭示 agent 管线隐坑

deadatreides1 · reddit · 2026-10-05

作者按标准流程搭了一条「写契约→写测试→写代码→跑测试→修复」的编码 agent 管线,然后做了一个少有人做的检查:把所有模型生成的测试喂给一个已知正确的参考实现,结果 168 个测试套件中 129 个(77%)拒绝了正确答案。

关键发现:

局限:用的是 360M-1.7B 的小本地模型、6 个任务,大模型表现会好多少未知。作者现在的做法是:最终裁决的测试必须来自规格或人写的示例,模型可以提案测试,但不能当裁判。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →