小型模型自写测试当关卡:77% 的测试误杀正确代码

deadatreides1 · reddit · 2026-10-05

Reddit 用户对「模型自写测试+自动修复」流水线做了一次少有人做的检查:四个本地 GGUF 小模型(qwen3-1.7b、qwen2.5-coder-1.5b、llama-3.2-1b、smollm2-360m)、6 个任务、785 次调用,把每套生成的测试喂给已知正确的参考解,结果 168 套中 129 套(77%)拒绝了正确答案。关键发现:

所属事件:实测揭示模型自写测试大量误杀正确代码(2 条相关)→

原文链接 →

「编程与Agent」频道最新

更多「编程与Agent」频道 AI 资讯 →