4 模型 2 文件隐藏测试:8 次修复中 3 次修好一处却弄坏另一处

lulzxdxdxd · reddit · 2026-10-10

作者用种子 bug + 模型不可见的测试套件做了对比实验:4 个模型各跑 2 次、temperature 0,所有 8 次运行都"修复"了报告的失败——但其中 3 次是靠弄坏套件里另一个测试做到的。

关键失败模式:模型读 traceback、精准修补报错行、症状消失,而被弄坏的测试从未被提及——因为它只有在第一个 bug 消失后才会失败。单文件任务暴露不了这个问题,双文件任务可以。

作者现在的检查清单:

最深的结论:在"被报告的失败"上的排名和在全套测试上的排名不同,只有后者能预测哪个模型三周后还在代码库里。如果你的 eval 只报告你问的那个失败,它看不到这一切,你最终留下的模型也不会是 eval 排名第一的那个。

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →