实测揭示模型自写测试大量误杀正确代码
Reddit 用户对流行的「模型自写测试并自动修复」编码 agent 流水线做了少见的质量检验:用 qwen3-1.7b、qwen2.5-coder-1.5b、llama-3 系列等四个本地 GGUF 小模型,按「写契约→写测试→写代码→跑测试→修复」的标准流程运行,再把模型生成的全部测试喂给已知正确的参考实现。结果显示约 77% 的测试会误杀正确代码,暴露出此类 agent 管线中测试可靠性被忽视的隐患。
2026-10-05 ~ 2026-10-05 · 2 条相关
- 模型自己写的测试 77% 概率误杀正确代码,实测揭示 agent 管线隐坑 — deadatreides1 · 2026-10-05
- 小型模型自写测试当关卡:77% 的测试误杀正确代码 — deadatreides1 · 2026-10-05