实测揭示模型自写测试大量误杀正确代码

Reddit 用户对流行的「模型自写测试并自动修复」编码 agent 流水线做了少见的质量检验:用 qwen3-1.7b、qwen2.5-coder-1.5b、llama-3 系列等四个本地 GGUF 小模型,按「写契约→写测试→写代码→跑测试→修复」的标准流程运行,再把模型生成的全部测试喂给已知正确的参考实现。结果显示约 77% 的测试会误杀正确代码,暴露出此类 agent 管线中测试可靠性被忽视的隐患。

2026-10-05 ~ 2026-10-05 · 2 条相关