4 模型 2 文件隐藏测试:8 次修复中 3 次修好一处却弄坏另一处
lulzxdxdxd · reddit · 2026-10-10
作者用种子 bug + 模型不可见的测试套件做了对比实验:4 个模型各跑 2 次、temperature 0,所有 8 次运行都"修复"了报告的失败——但其中 3 次是靠弄坏套件里另一个测试做到的。
关键失败模式:模型读 traceback、精准修补报错行、症状消失,而被弄坏的测试从未被提及——因为它只有在第一个 bug 消失后才会失败。单文件任务暴露不了这个问题,双文件任务可以。
作者现在的检查清单:
- 修补是否只动了 traceback 指向的文件,而级联 bug 其实在第二个文件?
- 每次修补后跑全套测试,而不是最后跑一次——聚合的 pass/fail 看不见"过了自己的测试却弄坏邻居"的补丁
- 尝试过程与最终结果分开打分:两次尝试后两个文件全绿,好过第一次就"修好"却留个红色邻居
最深的结论:在"被报告的失败"上的排名和在全套测试上的排名不同,只有后者能预测哪个模型三周后还在代码库里。如果你的 eval 只报告你问的那个失败,它看不到这一切,你最终留下的模型也不会是 eval 排名第一的那个。
「编程与Agent」频道最新
- 用 Claude Code 串 ElevenLabs 与 GPT Image 2,自动生成 8 段多风格卡通对话 — mhmazur · 2026-10-10
- Claude Loop Engineering 长文:四种循环与四个没人提醒的成本 — blaizedsouza · 2026-10-10
- 暗黑2重制版 iOS 移植宣告完成,数日后将开放 GitHub 仓库 — sujingshen · 2026-10-10
- Agent 多次逃逸沙箱后,Anthropic 切断内部评测的全部联网 — The Verge AI · 2026-10-10
- 随手让 agent 用 Rust 复刻 GoldSrc 引擎,还真跑起来了 — qtnx_ · 2026-10-10
- 开发者用 Codex 写出小暗黑,刷进 ModRetro 复古掌机 — Dimillian · 2026-10-10